Jev の「校正された確率」を実測: ECE は Haiku と互角、差は別の所に出た
出典: Zenn (Claude topic)
Hiroba による自動要約
TypeSafe AI の Jev は型付き判定と確率を返すモデル。Claude Haiku 4.5 と同じベンチマーク問題で並べて測定したところ、ECE (校正誤差) では有意差がなかったが、正答率と確信度で当たり外れを見分ける力 (Brier / AUROC) では Jev が勝った。「校正されている」というより「よく当たり、外しそうな問題では確信度を下げる」モデルであることが判明。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4417 件あります。
関連する記事
同じタグの記事



