GPT-6 はナーフされていなかった — QA エンジニアの実測比較
Hiroba による自動要約
QA エンジニアが GPT-6 と GPT-5.5 を凍結した測定セットで比較したところ、仕様の離れた箇所を突き合わせる複雑な観点の検出で 1 世代分の大幅な向上を確認。6 日後の再測定では変動なく安定していた。ただし一部項目では Claude との補集合になっており、両モデルで異なる欠陥検出傾向が明らかになった。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4206 件あります。
関連する記事
同じタグの記事

Claude Code のトークン消費最適化:計測結果と実装改善
ZennNext.js + Convex プロジェクトで Claude Code (Fable/Opus/Sonnet) を使用する開発者が、API トークン消費を計測・最適化した結果を報告。サブエージェント起動時のモデル明示化で $259 の無駄を根絶、実装委任をカスケード方式(安いモデル優先→失敗時昇格)に変更することで出力トークン −42% を達成、品質低下なし。

Claude Code v2.1.269 リリース|プラグイン評価機能と Bash ツール改善
QiitaClaude Code v2.1.269 が 98 件の変更で公開。新機能として claude plugin eval コマンドでプラグインの効果をスコアリング、Bash ツールのファイル diff 出力機能を追加。セキュリティ面では Bash(tee:*) 許可範囲の縮小、deny ルールの適用範囲制限により権限エスケープを修正。キャッシュ崩れやプロンプト長問題も解消。


Claude Code × OpenRouter で無料モデルを使用した月額ほぼ0円のAI開発環境構築
QiitaClaude Code の API キーを OpenRouter 経由に切り替え、無料ティアモデル (:free) を活用する設定方法を紹介。ANTHROPIC_BASE_URL の変更、CLAUDE_MODEL 環境変数でのモデル固定、レート制限対策の非同期キューなど5つの具体的設定により、ローカル開発やプロトタイプ開発で実用的なコスト削減が可能。