AIの鬼
#新モデル Qiita AI

DFlashでtok/sの意味が変わる — 24GB GPUでMuse Glimmer 30B・256K・Visionを実測した

DFlashでtok/sの意味が変わる — 24GB GPUでMuse Glimmer 30B・256K・Visionを実測した(内容を表す図ではないイメージ画像)
イメージ

LLM導入を検討する中小企業がベンダーに必ず聞く質問がある。「1秒間に何トークン処理できるか」つまり、速度だ。仕様表には「毎秒80トークン」などと書かれている。だが、それは嘘ではないが真実でもない。記事の著者が24GB GPUでMuse Glimmer 30Bを実測したところ、その答えが劇的に変わることが判明した。具体的には、量子化の選択だけでなく、CPU・GPU間の処理境界がどこにあるか、サンプリング設定は何か、コンテキストのどの位置にカーソルがあるかといった実装レベルの話が、全体速度に5〜8%の差をつける。さらに、同じモデルとGPUなのに、生成する内容によって速度が80トークン毎秒になったり、17トークン毎秒になったりする。コードを書く場合は予測しやすいので速い。会話や企画などの開放的な推論は遅い。この落差は、データシートには載らない。ベンダーが提示する「毎秒Xトークン」という数字は、最も条件の良いシナリオだけを測ったものだ。自社の実際のワークロードでは、その数字は参考にならない可能性が高い。「実測」と「仕様」の間には、大きなギャップが隠れている。実務的には、LLM導入前に必ず自社データと自社環境で動かして測ること。ベンダーの速度保証は額面通りに信じるべきではない。

※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。

御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →