Claude Opus は OpenCode ベンチマークで Claude Code より高いパフォーマンスを発揮
Hiroba による自動要約
Artificial Analysis Coding Agent Index による複合ベンチマーク測定で、Claude Opus 4.7 が Claude Code より優れた性能を示している。SWE-Bench-Pro-Hard-AA、Terminal-Bench v2、SWE-Atlas-QnA の 3 つのベンチマークを組み合わせ、実装性能、ターミナルワークフロー、リポジトリ理解能力を総合的に評価。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2899 件あります。
関連する記事
同じタグの記事

Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
ZennAnthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。

Claude Code 環境をスタートアップリポジトリで統一し、RTK・Lean-CTX によるトークン削減を実装する
Qiita複数環境での Claude Code セットアップの手間を削減するため、スタートアップリポジトリを構築し、RTK・Lean-CTX などのトークン削減ツールを自動導入する方法を解説。RTK 導入後、実務環境で 3.2% のトークン削減率を実現したが、出力圧縮による意図しない動作変化に対応する運用上の注意が必要。

Claude Code が入力前に送る 38,000 トークンの実際の支払いを測定
QiitaClaude Code はユーザー入力前にシステムプロンプトとツール定義で 38,000 トークンを API に送信しており、プロンプトキャッシュの効果を含めた実際の課金額を、自作リバースプロキシで計測した。初回リクエストのキャッシュ書き込み費用、ターン重ねたときの単価低下、キャッシュ無効化時の再課金条件を数値で検証し、API 従量課金利用時の実害を示す。
OpenCodex: Codex と Claude Code で複数の LLM を使用可能にするプロキシ
HNOpenCodex は、Codex CLI/App/SDK および Claude Code で OpenAI Codex API を任意の LLM プロバイダー (Claude、Gemini、DeepSeek、Ollama など) に転送するローカルプロキシツール。ストリーミング・ツール呼び出し・推論トークンに対応し、複数の ChatGPT アカウント管理と自動フェイルオーバー機能を備える。