AIエージェントの評価と品質保証 — 「動く」を「信頼できる」に変える検収の技術
AIに実装を任せたあと、何を根拠に受け入れ、改善し、モデルやプロンプトを更新するか。評価仕様、課題集、コードとLLMによる評価、評価器自体の検証、複数試行、継続評価、受け入れ記録を、共通のTypeScriptアプリでつなぎます。既知の六故障を使う評価器実験、一課題を六回実装した比較、四報告のLLM判定を収録。公開...
はてなテクノロジー
2026年09月13日 11:39