AIの鬼
Hugging Face

LFM2.5-VL-3B、エッジのビジョン能力を高速化

LFM2.5-VL-3B、エッジのビジョン能力を高速化(内容を表す図ではないイメージ画像)
イメージ

Liquid Intelligenceが発表した「LFM2.5-VL-3B」は、わずか3億パラメータの軽量ビジョン言語モデルだ。スマートフォンやエッジデバイスで走らせることを想定して設計されている。M5 Macなら秒当たり228トークン、スマートフォンでも20トークンのペースで動く。メモリ消費は3GB程度に抑えられており、これまでクラウドのGPU頼みだった画面読み込みや文書認識の仕事を、手元で完結できる。 注目すべきは、このサイズで「画面UIの理解」と「物体グラウンディング」が実用的な精度に達したことだ。つまり、あなたのスマートフォンが、あなたのスクリーンを見て「ここのボタンを押してください」と指示できる段階に来たということ。これまでは大型モデルにクラウド送信して返答を待つしかなかったのに対し、今はオンデバイスで完結する。応答速度も、プライバシー保護も、ずっと良い。AIが「データセンターの家具」から「手のひらの道具」へ移ったのだ。 中小企業の実務に落とすなら、ここが分岐点だ。いまこの瞬間に「大規模AIサービスを月額で借りる」か「軽量モデルを自社に置く」かの判断をしなければいけない。既存のクラウド型AIは、レスポンスが毎回1〜5秒かかるため、リアルタイム性が要る作業には向かない。しかし3Bモデルなら、オンプレミスでも応答が一瞬だ。特に製造現場のカメラで部品を認識させる、営業資料の表を瞬時に読み込むといった仕事は、軽量モデルの本領だ。

※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。

御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →