聞きながら話すGPT-Live、重い思考をGPT-5.5に回す2層構成
音声アシスタントに話しかけて、一拍おいてから返事が来る。あの微妙な間の正体は、たいてい「相手が黙るまで待ってから考え始める」という設計にある。マイク入力を音声認識(STT)にかけ、テキストをLLMに渡し、返答を音声合成(TTS)で読み上げる。この直列パイプラインは組みやすい代わりに、ターンの切れ目を無音で判定するので、会話がどうしても硬くなる。 7月8日にOpenAIが公開した GPT-Live は、その前提そのものを外してきた。ChatGPTの音声モードに載る新しいモデルで、聞くことと話すことを同時にやる。相づちを打ちながら聞き、こちらが喋っている途中で短く言葉を差し込み、必要なら黙っ...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →
