中学生の期末試験対策を、Claude Codeで“AI家庭教師チーム”運用してみた
複数のAIエージェントを、人間がプロジェクトマネージャーとして「チーム運用」する試みである。5教科の担当エージェント、品質管理エージェント、PMエージェントが、フォルダ権限を分けて分業した。1週間で診断テスト→対策→確認テストを回し、中学1年生の正答率を23ポイント上げた。すぐれた成果だが、最も学べるのは「失敗と改善」のプロセスだ。
生成AIが作る問題集には「正解が問題文に漏れている」という、人間なら気づくはずの不具合が繰り返し発生した。選択問題の見出しに答えが書かれていたり、正解語が別の設問に登場していたり、修正時に新しい漏洩を作ったり…ルール作成担当のエージェントに抽象的に「品質に気をつけよ」と指示しても効かなかった。最終的には「正解語一覧に対して全文検索し、ヒット0件であることを確認する」という機械的な手順に落とし込んで初めて収束した。つまり、AIチーム運用の実務では「曖昧な指示は通じない」という大前提が露呈した。
これは企業がAIを内製化する際に直面する本質的な課題だ。AIは「気をつけてね」では動かない。チェックリスト化、検索クエリ化、実測値の記録…人間が「何をどう確認するのか」を行動単位まで落とし込む必要がある。その過程でのみ、プロセスが堅牢になる。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


