自作AIベンチの測定値にばらつきが出た原因は、AIではなく採点器にあった——同じAIで最大4.3倍の差
Hiroba による自動要約
AIの性能比較ベンチマークで同じAIに同じ課題を10回実施したところ、最大4.3倍のスコア差が発生。著者が測定方法を疑って仮説を検証した結果、AIの変動ではなく採点器の欠陥が原因だったことが判明。ベンチマーク測定の信頼性確保と測定時の検証プロセスについての実践的な記録。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4893 件あります。
関連する記事
同じタグの記事

受託開発で Claude Code を安全側に倒す設定
QiitaClaude Code を受託開発で使う際、CLAUDE.md・権限設定・hooks の三層で安全側に寄せる構成を提案。自然言語ルールだけでなく、機械的な検査を組み合わせることで、指示していないファイル変更や git push、データベース更新といった予期しない操作を防止する方法を解説。

Claude Code v2.1.283:モデル管理機能強化と Windows PowerShell 重大バグ修正
QiitaClaude Code v2.1.283 では availableModelsMatch と deniedModels によるモデルバージョン管理の厳密化、/doctor prompt-audit による旧モデル向けプロンプト監査機能、権限モードの既定値変更が実装されました。Windows ユーザーは特に、PowerShell ツールで保護されるべきドライブルートやホームフォルダが削除可能になるセキュリティバグが修正されたため、優先してアップデートが必要です。

自作オーケストレーション廃止を通じて考える、モデル進化への向き合い方
ZennGENDA のエンジニアが、複数の Claude / Codex セッションを herdr のペインで並走させる baton プラグイン(最大 1477 行)を開発・運用してきたが、最近は使わなくなった。Opus 5 の prompting guide により検証ロジックが不要化したこと、Fable 5.1 による 25% の値下げで役割分けのコスト効率が低下したこと、Opus 5.5 登場による単一モデルの能力向上が理由。常駐ペインの運用コストとサブエージェント活用のバランスを再考している。

サブエージェントと Git Worktree の違いをゼロから理解する
QiitaClaude Code を使う際に混同されやすい「サブエージェント」と「Git Worktree」は、実は分離対象が異なる。Git Worktree は同じファイルの同時編集を防ぐため作業領域を分離し、サブエージェントはメイン会話のコンテキスト圧迫を避けるため文脈を分離する。本記事では両者の成り立ち、動作、使い分け方を整理する。