ニュース › OpenAI #新モデル OpenAI 2026年3月3日 GPT-5.3 Instant、日常会話がスムーズで実用的に イメージ このニュースの全文は、配信元でお読みいただけます。 OpenAIで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIエージェントはどこで失敗するのか?8,000超のAPI・62ドメインで測ったVAKRAが示す設計の上限 IBM Researchが公開したエージェント評価基盤VAKRAは、8,000以上のAPIと62ドメインを模した環境で、推論チェーン3〜7ステップを要しうる課題を解かせるものです。ツール候補の多さ、手順の長さ、社内ルールの遵守という3条件で失敗が増える構造を、中小企業の設計判断に引き直して読み解きます。 続きを読む → AI解体新書 チャットボット以外の業務AIでも「人の好み学習」は効くのか?OCRで出力崩れが平均59.4%減という実測 DPO(直接選好最適化)はチャット向けの手法という理解が一般的ですが、OCRという機械判定可能な業務で検証した結果、文字化けや無限ループといった出力崩れの発生率が平均59.4%、最良ケースで87.6%減ったという数字が出ています。ただし発信元は当該OCR製品の提供者であり、効果には3つの条件がつきます。 続きを読む → AI解体新書 画面を操作するAIは、社内PCで動かせる段階に来たのか(AndroidWorld 79.3%が示す現在地) H companyが公開したHolo3.1は、PC画面を見て操作するエージェントを0.8B〜35B-A3Bの複数サイズで提供し、モバイル操作精度は67%から79.3%へ改善したと報告しています。ただし発表は自社製品についての自社測定であり、最高性能でも約2割は失敗します。中小企業が今どこまで試せるかを整理します。 続きを読む →
AI解体新書 AIエージェントはどこで失敗するのか?8,000超のAPI・62ドメインで測ったVAKRAが示す設計の上限 IBM Researchが公開したエージェント評価基盤VAKRAは、8,000以上のAPIと62ドメインを模した環境で、推論チェーン3〜7ステップを要しうる課題を解かせるものです。ツール候補の多さ、手順の長さ、社内ルールの遵守という3条件で失敗が増える構造を、中小企業の設計判断に引き直して読み解きます。 続きを読む →
AI解体新書 チャットボット以外の業務AIでも「人の好み学習」は効くのか?OCRで出力崩れが平均59.4%減という実測 DPO(直接選好最適化)はチャット向けの手法という理解が一般的ですが、OCRという機械判定可能な業務で検証した結果、文字化けや無限ループといった出力崩れの発生率が平均59.4%、最良ケースで87.6%減ったという数字が出ています。ただし発信元は当該OCR製品の提供者であり、効果には3つの条件がつきます。 続きを読む →
AI解体新書 画面を操作するAIは、社内PCで動かせる段階に来たのか(AndroidWorld 79.3%が示す現在地) H companyが公開したHolo3.1は、PC画面を見て操作するエージェントを0.8B〜35B-A3Bの複数サイズで提供し、モバイル操作精度は67%から79.3%へ改善したと報告しています。ただし発表は自社製品についての自社測定であり、最高性能でも約2割は失敗します。中小企業が今どこまで試せるかを整理します。 続きを読む →