AIの鬼
#新モデル Ars Technica AI

GoogleがGemini 3.5 Transcribeを発表、AI音声テキスト化機能

GoogleがGemini 3.5 Transcribeを発表、AI音声テキスト化機能(画像: Ars Technica AI)
画像: Ars Technica AI(配信元より)

GoogleがGemini 3.5 Transcribeを発表した。Pixel 11のGboard『Rambler』機能に既に搭載されているAIだが、ChromeやGoogle全体に拡大する。従来モデルのChirp 3と比べて70%高速化、音声エラー率は7.32%から5.5%に低下。85言語対応、最大3話者。『えっと』『あの』といったフィラーを自動削除し、言い直しを自動修正する。カスタム語彙で専門用語にも対応。一見すると単なる音声認識の精度向上だ。だが業界的には重要な転換点を迎えている。音声UIが『実用段階』に入りつつあるからだ。PCやスマートフォンの歴史を見れば、キーボードとマウスの時代、タッチの時代、と変遷してきた。音声はずっと『便利だが不完全』という立場に甘んじてきた。だがテキスト入力の煩雑さ、キーボードのない環境での仕事、報告書や日報を『しゃべって記録する』というニーズが増えている中、精度が「使える域」に近づいた。ただし落とし穴がある。AIが『あなたが本当に言いたかったこと』を推測して言葉を変えるという行為だ。音声入力は『文言の正確さより意図の正確さ』を優先する設計になっており、これは議事録や法務文書には危険。中小製造業の現場では、進捗報告や簡単な日誌、スマートスピーカーへの指示という用途から始まるだろう。だが『AIが勝手に意図を汲んで修正する』という動作の癖を理解した上で使う必要がある。音声入力が本格化する前夜、その限界を知っておくことが実装の成否を分ける。

※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。

御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →