Claude Opus 5 と GPT-5.6 の性能比較、Claude Agent SDK でハーネス自作まで
Hiroba による自動要約
Claude Opus 5 は高性能だが操作性に癖があり、GPT-5.6 Sol はプロトタイプ作成・PRD 作成・ブラウザ操作でより優位という比較検証結果が報告された。Claude Agent SDK を使ったハーネス構築事例(プロンプト永続化による自動化)とテクニカル PM による Anthropic の内部戦略(token maxing・eval 駆動開発)の背景が紹介されており、モデル選定はタスク別の得意分野で判断する必要がある。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4562 件あります。
関連する記事
同じタグの記事

Claude Code の OpenTelemetry で計測できることと出来ないこと
ZennClaude Code が OpenTelemetry で送出できるメトリクス・ログ・トレースについて、実装環境で実際に計測した結果をまとめた記事。ユーザー別モデル使用量・ツール呼び出し回数・編集提案承認率は取得可能だが、リポジトリ別分類やプロジェクト別コスト分離は標準設定では不可能。トレース有効化(ベータ機能)でこれらの制限の一部は解決できる。

Claude / Claude Code 開発者向けニュースまとめ(2026-09-16)
QiitaAnthropic 関連のニュース索引。AI の安全性制御の難しさ、Claude Code の実装課題、MCP 経由での WhatsApp 連携、実コードベースでの AI エージェントの限界など、複数の技術・セキュリティ話題を網羅。研究成果と実運用のギャップが随所で浮かぶ。

Claude Code のトークン消費最適化:計測結果と実装改善
ZennNext.js + Convex プロジェクトで Claude Code (Fable/Opus/Sonnet) を使用する開発者が、API トークン消費を計測・最適化した結果を報告。サブエージェント起動時のモデル明示化で $259 の無駄を根絶、実装委任をカスケード方式(安いモデル優先→失敗時昇格)に変更することで出力トークン −42% を達成、品質低下なし。

Claude Code v2.1.269 リリース|プラグイン評価機能と Bash ツール改善
QiitaClaude Code v2.1.269 が 98 件の変更で公開。新機能として claude plugin eval コマンドでプラグインの効果をスコアリング、Bash ツールのファイル diff 出力機能を追加。セキュリティ面では Bash(tee:*) 許可範囲の縮小、deny ルールの適用範囲制限により権限エスケープを修正。キャッシュ崩れやプロンプト長問題も解消。