エージェント前提の開発基準をA/B比較したら、効いていたのはAI一次レビューだけだった
エージェントに実装させる前提の開発基準を、自分でA/B比較した 前回、コーディングエージェントに実装を任せたコードをどう検証するか——「独立照合」という手順を作って実際に回した話を書きました。 その後、こういう指摘をもらいました。 従来のやり方でも発見できてるってことは、今回のスキルは意味ないってこと? これに答えるには測るしかないので、同じチケットを2レーンに流しました。結果は基準に不利で、しかも測っていたものが自分の思っていたものと違ったという話です。 やったこと 題材は不可逆系。退会したユーザーのデータ削除です。削除は取り消せないので、間違えたら戻せない。 チケットは実...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


