RAGが正しい証拠を持っていても誤答するSAEG を回避する方法—AWS Bedrockで split call による2段階呼び出しを検証
出典: DevelopersIO (Claude tag)
Hiroba による自動要約
RAGシステムが正しい文書を保有していても表層パターンに引きずられて誤答するSAEGの問題に対し、Transformer内部介入の代わりにAPI呼び出し構造を2段階に分割する split call 手法をAWS Bedrockで実装。3つのベンチマーク(2WikiMultiHopQA +14.0pp、MuSiQue +12.0pp、HotpotQA ±0.0pp)で検証し、特に複数エンティティを経由する推論で正答率改善を確認。
出典・元記事
DevelopersIO (Claude tag) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2740 件あります。
関連する記事
同じタグの記事

Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
ZennAnthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。


Claude Code 環境をスタートアップリポジトリで統一し、RTK・Lean-CTX によるトークン削減を実装する
Qiita複数環境での Claude Code セットアップの手間を削減するため、スタートアップリポジトリを構築し、RTK・Lean-CTX などのトークン削減ツールを自動導入する方法を解説。RTK 導入後、実務環境で 3.2% のトークン削減率を実現したが、出力圧縮による意図しない動作変化に対応する運用上の注意が必要。

Claude Code が入力前に送る 38,000 トークンの実際の支払いを測定
QiitaClaude Code はユーザー入力前にシステムプロンプトとツール定義で 38,000 トークンを API に送信しており、プロンプトキャッシュの効果を含めた実際の課金額を、自作リバースプロキシで計測した。初回リクエストのキャッシュ書き込み費用、ターン重ねたときの単価低下、キャッシュ無効化時の再課金条件を数値で検証し、API 従量課金利用時の実害を示す。