AIに何回ダメ出ししたかを測る、対話型ベンチSWE-Together
Hiroba による自動要約
SWE-Togetherは、従来のベンチマークが測らない「実際の対話過程での介入回数」を定量化する新しい評価手法。ユーザーの修正指示(correction)と軽い催促(nudge)を加重平均した User Correction 指標を導入し、同じ成功率でも手間の少ないエージェントを区別できるようにした。Claude Opus 4.8は1.38回の平均介入回数で最も効率的だが、評価の再現性向上と手作業による母数限定が課題。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 3709 件あります。
関連する記事
同じタグの記事

AIエージェントに「記憶」を持たせるべきか。文脈が累積するかで決まる
ZennClaude Code などのエージェントが過去のやり取りを自動で思い出す「記憶」機能は、文脈の連続性に大きく依存する。単一のサービスコードベースなど累積型の文脈では有効だが、複数プロジェクトが混在する環境では逆効果になり、精度を損なう可能性がある。機能導入前に、自分の用途で文脈が積み上がるか入れ替わるかを見極める必要がある。
Agents Workbook: Claude Code と Codex のエージェント推論をリアルタイム監視するローカルプロキシ
HNClaude Code / Codex の動作中に、エージェントの思考プロセスをリアルタイムで監視・記録するローカルプロキシツール。ブラウザダッシュボード上に各ステップの推論内容(検討事項、却下した選択肢、理由)を表示し、エージェントの声明上の計画と実際の行動が一致しているか検証できる。

AIエージェント10体で仮想QAチームを組んだ話
Zenn品質戦略を1人で担当する課題から、Claude Code のカスタムエージェント機能で10体の専門化されたAIエージェントを構築。司令塔エージェント・設計・分析・データ・アウトプット・独立型の5レイヤー構成で、テスト設計・品質分析・Qase運用・ダッシュボード設計などの業務を分担。ツール権限やモデルの使い分けにより、汎用AIの失敗(APIパラメータの誤りで21万件のデータ破損など)を防止。

記憶を失った執事 — コンパクションとモデル更新、長時間稼働AIエージェントの2大外乱
ZennClaude Code マルチエージェント「Lady's servants」の5ヶ月運用で発生した2つの外乱への対策を記録。コンテキスト圧縮により執事長が役割を忘れて部下の業務を自分で実行した事件と、モデル更新で指示文の解釈バランスが変わり起動儀式をサボるようになった事件を、検証ループと儀式の設計で解決。