ニュース › OpenAI #開発・実装 OpenAI 2026年3月5日 Adoptionニュースチャネル開始 イメージ AIの進展をビジネス優位性に転換するための実践的なインサイトとフレームワーク。 出典: OpenAI(配信元の紹介文より引用) このニュースの全文は、配信元でお読みいただけます。 OpenAIで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む → AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む → AI解体新書 AIエージェントは作業を完了しても、途中の安全ルールを守れているのか(507件の検証で安全遵守率0.16〜0.40) VLMで動くエージェントを507件の課題で検証した研究では、易しい条件では成功率0.83〜0.94・安全遵守率最大0.91だったのに、物の上下や中身が絡む配置では成功率0.52〜0.73・安全遵守率0.16〜0.40まで落ちました。結果だけ見る検収では足りない理由を、中小企業の実務に置き換えて読み解きます。 続きを読む →
AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む →
AI解体新書 帳票読み取りAIに「考えさせる」のは必要か?推論なしが0.411、推論ありが0.303だった検証 請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。 続きを読む →
AI解体新書 AIエージェントは作業を完了しても、途中の安全ルールを守れているのか(507件の検証で安全遵守率0.16〜0.40) VLMで動くエージェントを507件の課題で検証した研究では、易しい条件では成功率0.83〜0.94・安全遵守率最大0.91だったのに、物の上下や中身が絡む配置では成功率0.52〜0.73・安全遵守率0.16〜0.40まで落ちました。結果だけ見る検収では足りない理由を、中小企業の実務に置き換えて読み解きます。 続きを読む →