Gemini APIに動画理解が進化「エージェント型動画理解」でトークン最大88%削減
Googleが動画を理解するAIを進化させた。技術的には「エージェント型動画理解」と呼ぶが、要するに、AIが「この質問に答えるには動画のこの部分が必要だ」と自分で判断して、必要な部分だけを取ってくるようになったということである。 従来は、AIに動画を見せるときに動画全体をモデルに投入していた。2時間の会議録画を解析するなら、2時間分のフレーム・音声をすべて処理する必要があり、その結果トークン(利用料金の単位)が膨大になった。ところが今回の更新で、Gemini 3.7 Flash以降のモデルなら、動画全体ではなく「『予算について話している箇所』だけをオンデマンドで取ってくる」という賢い読み方ができるようになった。Googleの発表では、長尺コンテンツで最大88%のトークン削減が見込めるという。 これは一見「技術の細かい改善」に見えるが、業界的には水準線が変わったことを意味している。かつてAIで動画解析をやろうとすると、「長い動画はコストが跳ね上がるから避けたい」というジレンマがあった。監視カメラ映像、会議の自動記録、講義動画の自動要約――こうした「退屈だが重要な長尺コンテンツ」は、AIに任せる選択肢が「贅沢」「コスト合わない」と見なされていた。その枷が外れたということだ。 中小企業の現場では、これが一つの転機になる。社内会議をすべてAIに見張らせて「今月の重要な決定は?」と聞く、製造ラインの監視カメラから「いつ誰がどこで止まったのか」を自動抽出する――こうした使い方の敷居が、一気に下がった。もう「動画は長すぎてAIに見せられない」という言い訳は成立しない。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Qiita AIで元記事を読む →


