Claude Fable 5が消えた日 ─ 2026年6月のLLMベンチマーク調査と代替モデル選択ガイド
Hiroba による自動要約
Fable 5が輸出管理指令対応で提供停止され、代替LLMの選択が急務となった。SWE-bench Verifiedなどベンチマーク数値の「公認記録」と「参考記録」の区別や、標準化ハーネスとベンダー独自ハーネスの差(10~30ポイント)を踏まえ、用途別に最適なモデルを選ぶ判断軸を解説。最強とコスパは別種目だ。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 3005 件あります。
関連する記事
同じタグの記事

Claude Opus 5 と GPT-5.6 の性能比較、Claude Agent SDK でハーネス自作まで
QiitaClaude Opus 5 は高性能だが操作性に癖があり、GPT-5.6 Sol はプロトタイプ作成・PRD 作成・ブラウザ操作でより優位という比較検証結果が報告された。Claude Agent SDK を使ったハーネス構築事例(プロンプト永続化による自動化)とテクニカル PM による Anthropic の内部戦略(token maxing・eval 駆動開発)の背景が紹介されており、モデル選定はタスク別の得意分野で判断する必要がある。

Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
ZennAnthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。

Claude Code 環境をスタートアップリポジトリで統一し、RTK・Lean-CTX によるトークン削減を実装する
Qiita複数環境での Claude Code セットアップの手間を削減するため、スタートアップリポジトリを構築し、RTK・Lean-CTX などのトークン削減ツールを自動導入する方法を解説。RTK 導入後、実務環境で 3.2% のトークン削減率を実現したが、出力圧縮による意図しない動作変化に対応する運用上の注意が必要。

Claude Code が入力前に送る 38,000 トークンの実際の支払いを測定
QiitaClaude Code はユーザー入力前にシステムプロンプトとツール定義で 38,000 トークンを API に送信しており、プロンプトキャッシュの効果を含めた実際の課金額を、自作リバースプロキシで計測した。初回リクエストのキャッシュ書き込み費用、ターン重ねたときの単価低下、キャッシュ無効化時の再課金条件を数値で検証し、API 従量課金利用時の実害を示す。