Opus 5にしておけば勝ちではない。Anthropic公式記事から読むAIエージェントの「ハーネス」超入門
Hiroba による自動要約
AIエージェントの性能は、モデルの能力だけでなく「ハーネス」(入力処理・ツール呼び出し・結果返却の仕組み)で大きく変わる。Anthropic公式資料では同じOpus 4.5でも、単独エージェントと複数エージェント構成では完成度が異なり、16体のClaudeを並列動作させたC言語コンパイラ開発実験では適切なタスク分担とハーネス設計が不可欠だった。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 5075 件あります。
関連する記事
同じタグの記事

Claude Code 開発者が押さえておきたい Anthropic ニュース(2026年10月)
QiitaClaude Agent SDK の停止ポイント設計、小型モデルの値下げとエージェント用途への適性、LLM wiki 構築における追跡可能性と信用性の重要性など、実運用で必要とされる Anthropic の最新情報を整理。説明文の質より検証可能な記録としての記述が LLM 活用の鍵となる点を強調。

AIコーディングエージェントの作業を記録・比較・ロールバックするツール「AX Code」を開発
QiitaClaude Code、Cursor などのAIコーディングエージェントがコード変更した際に、実行過程を記録・検証・比較・復旧できるランタイムツール「AX Code」を開発。作業履歴の可視化、複数AIモデルの実装結果比較、変更の影響範囲分析、ローカルモデル対応などの機能を提供し、Git だけでは把握できないAI の作業プロセスを追跡可能にする。

実際の企業コードでAIモデルの性能を測る「Real-SWE」ベンチマーク
Zenn従来のSWE-benchはオープンソースコードのみを対象としているが、Real-SWEは実際の企業プライベートコードベースを使用してAIモデルを評価する新しいベンチマーク。ドメインロジック・レガシーコード混在・複雑な依存関係など実務特有の課題に対応したAIエージェントの真の能力を測定し、企業導入時の実用性判断に活用できる。
AI Agent の過去セッションを Go で抽象化する
Zenn複数の AI Agent に対応した CLI ツール ccsession を開発。異なるフォーマット (Claude Code と Codex の JSONL) で保存された過去セッションの履歴を統合データ構造として抽象化し、検索・再開機能を実装。