ニュース › Hugging Face Hugging Face 2026年7月15日 モデルルーティングはシンプル。ただし現実は複雑 画像: Hugging Face(配信元より) このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → この話題に関連する、TOEの実践・観測記録 ニュースの背景を、当社が実際にAIを動かした一次記録から補足します。 AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む → AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む → AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む → 御社でもAIを使ってみませんか まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 → AI検索で自社がどう見えるか知りたい ChatGPTやPerplexityで自社が言及されるかを実際に測ります。 引用を約束するものではなく、まず現状を測るサービスです。 AI検索可視性診断 → Webサイトを改善したい 測った結果、サイト側に原因があった場合の改善まで対応します。 Web制作25年・1000案件の実績があります。 SEO・Webサイト改善 →
AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む →
AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む →
AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む →