AIの鬼
#新モデル Google DeepMind

Gemini 3.5 Transcribeで高度な音声テキスト化が実現

Gemini 3.5 Transcribeで高度な音声テキスト化が実現(内容を表す図ではないイメージ画像)
イメージ

GoogleはGemini 3.5 Transcribeを発表した。従来の音声認識モデルと異なり、このモデルは背景ノイズや専門用語の多い環境で高精度の音声テキスト化を実現する。開発者向けにはLive APIでのストリーミング処理(遅延1秒未満)と、Interactions APIでの事前録音処理の2つのインタフェースが提供される。85言語以上に対応し、Word Error Rate(単語誤認率)はストリーミングで4.0%、非ストリーミングで2.6%と、前世代のChirp 3から大幅に改善されている。カスタム語彙機能により、業界固有の用語や企業独自の言葉も正確に認識できるようになった。

このモデルの登場が示唆するのは、AIエージェント時代における「聴覚の民主化」だ。これまでテキストベースのAIは、インターネット上のテキスト情報を効率的に処理できていた一方で、音声コンテンツはほぼ「見えない」領域だった。しかし高精度な音声テキスト化が可能になれば、会議記録、カスタマーサービス、市場調査といった音声データが、初めてAIの処理対象になる。企業の内部データベースに眠る膨大な音声資源が、一気に構造化可能なデータに変わるのだ。Googleはこの変化をいち早く認識し、APIレベルで提供することで、開発者が簡単にこの機能を組み込める環境を整備した。

企業の導入観点では、カスタマーサービスの自動化、会議の自動要約、コンプライアンス対応の音声ログ分析といった用途が即座に浮かぶ。特に多言語対応により、海外拠点の通話を自動的に処理する道が開かれた。これまで手作業だった音声データの処理が、数行のコード記述で実現可能になるのである。

※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。

御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →