技術文書RAGの検索品質・ハルシネーション対策・コストを実測する
出典: Zenn (Claude topic)
Hiroba による自動要約
Claudeの公式ドキュメント66ページを対象にしたRAGシステムについて、検索品質(recall@1/recall@3/MRR)、ハルシネーション抑制、1クエリあたりのコストを評価ハーネスで実測した結果を報告。リランカーはハイブリッド検索で難易度の高い質問のみに効果があり、素のRRFは順位を悪化させることが判明。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4416 件あります。
関連する記事
同じタグの記事


TypeSafe Jev と Claude でニュース選別を 53 日分比較 — 1 日 1 秒・0.1 セントの判定器
ZennTypeSafe 社の Jev(System One Model)を使用したニュース選別を 53 日分の実データで検証。速度・コストは本物で 1 日約 1 秒・約 $0.001 だが、要約文だけでは採用記事の順位判定に不向き。フィルタとしては有効で、実装時の罠(ラベリング、期待値計算)を詳解。

Claude Code の OpenTelemetry で計測できることと出来ないこと
ZennClaude Code が OpenTelemetry で送出できるメトリクス・ログ・トレースについて、実装環境で実際に計測した結果をまとめた記事。ユーザー別モデル使用量・ツール呼び出し回数・編集提案承認率は取得可能だが、リポジトリ別分類やプロジェクト別コスト分離は標準設定では不可能。トレース有効化(ベータ機能)でこれらの制限の一部は解決できる。
