GPT-5.6 Sol は Fable 5 超え:47万行の実レガシーコードで検証
Hiroba による自動要約
OpenAI が発表した GPT-5.6 Sol が Fable 5 をベンチマークで上回ると謳う主張を、実運用されていた Struts ベースの金融システム(約47万行)で検証した。Fable 5 との再計測を含む同一条件下で、両モデルの発掘能力・コスト効率・セーフガードの安定性を比較、実務レベルのレガシー診断での実用性を採点する。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 5264 件あります。
関連する記事
同じタグの記事

Claude Sonnet 5.5は単価据え置きで最大3割安い理由と、Opus 5.5のeffort設定
Zenn9月28日公開のClaude Sonnet 5.5は単価据え置き(入力$2/出力$10)ながら、使用トークン数削減により最大3割安くなる。Opus 5.5はeffortの既定値が高から中に変更されたため、前バージョンの設定を踏襲すると応答が長く高額になる。キャッシュ活用度が高いほど価格差が縮まる特性がある。

Claude Code v2.1.296 の主要アップデート - サブエージェント機能強化と Read ツールの allow_large 追加
DevIOClaude Code v2.1.296(10月9日リリース)では 79 件の変更が実施されました。サブエージェント向けに autoCompactWindow と CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL を追加し、Read ツールに allow_large オプションを実装。Shift-JIS など非 UTF-8 ファイルの編集時の不具合修正とセキュリティ改善も含まれます。

ぬいぐるみが「カブ」に見えた — 画像認識モデルの選定を実測で判断した話
Zenn写真を撮ると単語シールになるアプリで、ぬいぐるみが消える不具合が発生。原因を特定するため、複数の Claude モデルを同じ画像で実測比較した結果、claude-haiku-5-5 が claude-sonnet-5-5 と同等の精度を 1/20 の価格で実現することを確認。実装時の設定ミスや採点基準の重要性も明らかになった。

Claude Haiku 5.5 と GPT-6 Luna の API 費用比較:トークン境界と合格率
QiitaClaude Haiku 5.5 と GPT-6 Luna の API 価格を公式単価とサードパーティ掲載価格で比較。入力10万トークン超~27万2,000以下の範囲では Haiku が Luna の 5 倍の単価になり、27万2,000超では新規入力で約 2.5 倍の差が生じることを具体的な計算例で示す。モデル選定は単価比較だけでなく処理ごとの合格条件定義が必要。