OpenAI Realtime API

AIが空耳する日 — OpenAI Realtime APIの誤検知対策、文字起こし崩壊の犯人探し、そしてコンテナ化

机を叩くとAIが反応する誤検知、突然の文字起こし崩壊——ログから犯人を追い詰める謎解き2本と、Dockerコンテナ化。リアルタイム音声AI開発記の続編。
AI

「コードは読まない」開発スタイル ― Mermaid図解とモジュール分割で人間とAIの分業を作る

人間はコードを読まず、図と意図を持つ——Mermaid図解の運用ルールと、522行のmain.pyを7モジュールに分割した記録。PR単位開発記その2。
Azure

Azure OpenAI Realtime API (GA) は「OpenAI互換」をどこまで信じていいか

Azure OpenAI Realtime API(GA)の「OpenAI互換」を404から401まで実測で検証。APIスキーマは同一でも、WebSocket認証方式とエフェメラルキーTTLに非互換が潜む。
AWS

GA直後のAWS Lambda MicroVMsをGoで試す — suspendしてもカウンタを覚えているサーバレス

GA直後のAWS Lambda MicroVMsをGoで検証。起動2.5秒、suspend中に叩いても985msで自動復帰し、メモリ上のカウンタが生き残る。ステートフルなサーバレスの構成判断とデバッグ記録。
AI

Terraformで電話網に「盗聴されない盗聴器」を建てる — crossbar_telepath 開発記 (1)

通話相手の心理状態をAIがリアルタイムに読むcrossbar_telepathの開発開始。話者分離を「買う」アーキテクチャ判断と、録音を相手に宣言する設計思想。Terraform電話網開発記その1。
AWS

Claude Codeと1日で作るリアルタイム音声AI ― $5から始めて、RAG・ペルソナ・Cognito認証・Terraformまで

ブラウザからPush-to-Talkで話すリアルタイム音声AIを、Claude Codeと1日で構築。$5の予算からWeb検索RAG、配信者風ペルソナ、Cognito認証、Terraformまで辿り着いた開発記。
AI

ローカルLLMは推論より抽出 — RTX 2070+Gemma 9Bで会話ログの要件抽出を試す

ローカルLLMは推論タスクより抽出・マッチングで実用になる。RTX 2070+Gemma 9Bで、旅行予約の会話ログからの要件抽出を試した記録。
Firecracker

FirecrackerのSnapshotとResume

FirecrackerのSnapshot作成とResumeの手順をスクリプト付きで解説。Resumeによるマイクロ秒級のマシン復旧を体感する。
Firecracker

FirecrackerのResumeのRAMイメージとrootfs

FirecrackerのResumeに必要なrootfs・snap・RAMイメージの関係を図解で整理。同一rootfsを複数VMで復元するとディスクが壊れる理由と、3つの回避策。
Firecracker

Firecrackerのネットワーク設定

FirecrackerのマイクロVMにTAPデバイスを認識させ、カーネルパラメータでIPアドレスを渡すネットワーク設定をスクリプト付きで解説。