知識蒸留をスケール運用可能なコスト水準まで削減
大規模言語モデルの爆増に伴い、それらを実用的なサイズに圧縮する「知識蒸留」という技術が改めて注目を集めています。Qwen、Kimi、GLMといったオープンソースの大規模モデルが次々と出現し、Kimi-K3のように2.8兆パラメータという膨大な規模を持つ一方、本番環境にこうしたモデルを置くには数テラバイトのVRAMが必要になり、実質的に大企業の専有になっていました。そこで小さいモデルに知識を蒸留し、大型モデルの性能をコンパクトに再現しようという動きが加速しているわけです。ただし、この蒸留プロセス自体が非常に重いという困難がありました。
知識蒸留の仕組みは単純です。大きなモデル(teacher)を動かして確率分布を取得し、小さいモデル(student)がそれに近づくよう学習させる。ところが実装の詳細が厄介で、studentを訓練する間じゅうteacherをメモリに乗せたままにし、語彙サイズ全体の確率値を毎ステップ計算する必要があります。gpt-oss-120bの場合、語彙は20万語を超え、シーケンス長32,000、バッチサイズ4というありふれた設定でも、teacher出力だけで50GB、全体では250GBのVRAM消費に達します。つまり、この従来的なオンライン蒸留は、企業レベルのスケールで実験しようとしたら数百のGPUと複雑なテンソル並列化が必須という状態でした。
最近の研究では、この構造的な無駄を2つの工夫で削減しています。1つ目は、teacherの出力を一度だけ計算して、各位置ごとに確率の高い100個のトークンだけをキャッシュし、studentの学習はこのキャッシュから行うというオフライン蒸留です。teacherをメモリから解放でき、学習ステップごとの再計算も不要になります。2つ目は、KL散度損失関数の計算方法を再設計し、語彙サイズ×シーケンス長というメガサイズの行列を作らず、チャンク処理で段階的に計算することです。この2つの改善で、必要なVRAM量は250GBから128GB程度に低下し、最新のシングルGPU(例えばH200やB200)の範囲内で蒸留が可能になっています。
この変化の意味を考えると、大型モデルの民主化がいよいよ現実化したといえます。従来は「巨大企業がプロプライエタリモデルを内製し、中小企業は外部APIを借りる」という構造でした。ところが、高性能な開放型モデルの蒸留がシングルGPUで運用可能なレベルになれば、自社データに特化したカスタムモデルを中小企業も保有でき、推論コストも削減できる。アルゴリズムの工夫がコスト構造を変える典型例であり、単なる「安くなった」ではなく「実装の適切さが経営判断を左右する」という新しい局面です。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む →


