ニュース › Hugging Face Hugging Face 2026年4月1日 Gradioのバックエンドで自由なフロントエンド構築を実現 イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む → AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む → AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む →
AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む →
AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む →
AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む →