フェイフェイ・リー氏のWorld Labs、空間知能オムニモデル「Atlas」発表 少数の画像から3D空間やバレットタイム映像を生成
スタンフォード大学でImageNetを構築したフェイフェイ・リー博士が設立したWorld Labsが、空間知能モデル「Atlas」を発表した。テキスト、画像、動画、3Dをネイティブに扱う「オムニモデル」として一からトレーニングされたもので、3つの革新的な用途を持つ。第一に、1~数枚の参照画像をもとに、任意のカメラ位置・角度から新しい視点の映像を生成する「カメラ制御生成」。第二に、少数の画像から実在の空間を忠実に3D再構成する「空間再構成」。第三に、スマートフォンで撮った短い動画から、ロボットのシミュレーション環境とセンサーデータを丸ごと生成する「時空間シミュレーション」である。ベンチマーク評価では、MiniMax H3やGoogle Gemini Omni Flash、Seedance 2.5といった他の最先端モデルを大きく上回る精度を示している。AIの鬼が見る意味は深い。これまでの生成AIは「テキスト→画像」「画像→テキスト」という2次元的な変換が中心だった。Atlasの革新は「3D空間コンテキストを保持したまま、全モーダルを同時に理解し生成する」という次元の転換だ。2~3枚の写真から実在の空間を丸ごと再構成し、「その空間を別の角度から見たら」という想像を高精度で実現する。これはロボティクスに革命をもたらす。スマホで撮った数秒の動画から、あらゆる角度・照明・物体配置のセンサーデータを合成生成できれば、ロボット学習用の大規模データセット作成という「人類最大級の課題」が瞬く間に解ける。フェイフェイ・リーという「ビジョンAIの最高権威」による発表は、3D空間理解がAI進化の次の戦場であることを業界に告げた。中小企業のロボット導入検討者は今、方針転換が必要だ。ここ1~2年で、AIシミュレーション学習がロボット導入のスタンダードになることを前提に計画を立てるべき。データ準備の手間が激減する世界が来ている。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 ITmedia AI+で元記事を読む →
