Claude Code の性能低下が Opus 4.8 リリース前に検出
Hiroba による自動要約
開発者が SWE-Bench-Pro を用いた日次追跡で、Opus 4.7 のパフォーマンスが 5 月下旬に baseline (65%) から大幅に低下し、Opus 4.8 リリース直後に回復したことを記録。同期間に Claude Code バージョン 2.1.150~2.1.152 で tool calls 使用量が 60% 増加し input tokens が減少する異常パターンも検出された。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2840 件あります。
関連する記事
同じタグの記事

「Vibe Coding」はもう卒業!プラグイン「Superpowers」でClaude Codeに開発SOP を導入する
QiitaClaude Code で AI がいきなりコードを書く「Vibe Coding」の問題を解決するオープンソースプラグイン「Superpowers」を紹介。仕様の明確化・設計・テスト駆動開発・レビューを強制する 7 フェーズパイプラインにより、手戻りの削減と品質の安定化を実現する。

Claude Code だけで要件定義から本番デプロイまで完走した話 - サモエドカフェのファンサイトを実働10時間で作った
Zenn個人開発者が Claude Code を要件定義から本番デプロイまで使い、サモエドカフェのファンサイト「アルファン」を実働10時間未満で完成させた。並列エージェントで7件の Issue を同時処理し、本番バグとデータ消失も AI の支援で復旧。開発のプロセスが「コード実装」から「仕様判断と品質確認」にシフトした実例

Claude「Computer Use」を本番環境で安定稼働させるための実践ガイド
ZennAnthropic公式がComputer Use機能を本番環境で信頼性高く動作させるためのノウハウを公開。クリック精度改善、Thinking Effortの選択、コンテキスト管理、デモンストレーション記録など4つのポイントを通じ、UIを自律操作するエージェントの実装と運用方法を解説している。

Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
ZennAnthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。