手話からテキストへ変換するAI、Deaf・難聴ユーザー向けに登場
何が起きたのか。Googleが「手話からテキストへの変換AI」(SL2T)を開発し、スマートフォンの入力方式として実装した。Pixel 11の「Gboard」と「Live Transcribe」という2つのアプリで、米国手話(ASL)から英語へのリアルタイム変換が可能になる。同社は100,000時間以上の手話動画を学習データとして、50以上の手話言語をモデルに組み込んだ。MediaPipe Holisticという技術で手や腕だけでなく、顔や上半身全体の動きを追跡してテキストに変換する。
このニュースの本質は「AIが言語を『音と文字』だけで処理する時代が終わった」という宣言だ。従来のAI音声認識や翻訳は、音声を文字に変換する「シーケンシャルな処理」だった。だが手話は異なる。同じ「英語を手話で表現するだけの符号」ではなく、手・腕・胴体・顔・頭の同時多発的な動きで意味を作る独立した言語だ。つまり、AIが手話を理解するには「全身を読む」という身体的な知覚が必要になった。これは言語AIの技術的な進化の軌跡を示している。最初は音声→テキスト。次は画像認識。そして今は、「動き」という時系列の身体情報を意味に変換する能力だ。世界の聴覚障害者は推定70百万人。彼らが同じ入力速度・自然さで、スマートフォンを使える時代が来ようとしている。
アクセシビリティ機能がAIに組み込まれるということは、アクセシビリティ対応がもはや「良心的な配慮」ではなく「標準機能の実装」になるということだ。自社のウェブサイトやアプリに字幕・音声機能・操作ガイドを手動で用意する手間が減る一方で、対応していない企業は自動で取り残される時代が来た。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Google DeepMindで元記事を読む →


