Claude Opus 5 と GPT-5.6 の性能比較、Claude Agent SDK でハーネス自作まで
Hiroba による自動要約
Claude Opus 5 は高性能だが操作性に癖があり、GPT-5.6 Sol はプロトタイプ作成・PRD 作成・ブラウザ操作でより優位という比較検証結果が報告された。Claude Agent SDK を使ったハーネス構築事例(プロンプト永続化による自動化)とテクニカル PM による Anthropic の内部戦略(token maxing・eval 駆動開発)の背景が紹介されており、モデル選定はタスク別の得意分野で判断する必要がある。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2980 件あります。
関連する記事
同じタグの記事

Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
ZennAnthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。

Claude Code 環境をスタートアップリポジトリで統一し、RTK・Lean-CTX によるトークン削減を実装する
Qiita複数環境での Claude Code セットアップの手間を削減するため、スタートアップリポジトリを構築し、RTK・Lean-CTX などのトークン削減ツールを自動導入する方法を解説。RTK 導入後、実務環境で 3.2% のトークン削減率を実現したが、出力圧縮による意図しない動作変化に対応する運用上の注意が必要。

Claude Code が入力前に送る 38,000 トークンの実際の支払いを測定
QiitaClaude Code はユーザー入力前にシステムプロンプトとツール定義で 38,000 トークンを API に送信しており、プロンプトキャッシュの効果を含めた実際の課金額を、自作リバースプロキシで計測した。初回リクエストのキャッシュ書き込み費用、ターン重ねたときの単価低下、キャッシュ無効化時の再課金条件を数値で検証し、API 従量課金利用時の実害を示す。
OpenCodex: Codex と Claude Code で複数の LLM を使用可能にするプロキシ
HNOpenCodex は、Codex CLI/App/SDK および Claude Code で OpenAI Codex API を任意の LLM プロバイダー (Claude、Gemini、DeepSeek、Ollama など) に転送するローカルプロキシツール。ストリーミング・ツール呼び出し・推論トークンに対応し、複数の ChatGPT アカウント管理と自動フェイルオーバー機能を備える。