RAGが正しい証拠を持っていても誤答するSAEG を回避する方法—AWS Bedrockで split call による2段階呼び出しを検証
Hiroba による自動要約
RAGシステムが正しい文書を保有していても表層パターンに引きずられて誤答するSAEGの問題に対し、Transformer内部介入の代わりにAPI呼び出し構造を2段階に分割する split call 手法をAWS Bedrockで実装。3つのベンチマーク(2WikiMultiHopQA +14.0pp、MuSiQue +12.0pp、HotpotQA ±0.0pp)で検証し、特に複数エンティティを経由する推論で正答率改善を確認。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4179 件あります。
関連する記事
同じタグの記事

Claude Code のトークン消費最適化:計測結果と実装改善
ZennNext.js + Convex プロジェクトで Claude Code (Fable/Opus/Sonnet) を使用する開発者が、API トークン消費を計測・最適化した結果を報告。サブエージェント起動時のモデル明示化で $259 の無駄を根絶、実装委任をカスケード方式(安いモデル優先→失敗時昇格)に変更することで出力トークン −42% を達成、品質低下なし。

Claude Code × OpenRouter で無料モデルを使用した月額ほぼ0円のAI開発環境構築
QiitaClaude Code の API キーを OpenRouter 経由に切り替え、無料ティアモデル (:free) を活用する設定方法を紹介。ANTHROPIC_BASE_URL の変更、CLAUDE_MODEL 環境変数でのモデル固定、レート制限対策の非同期キューなど5つの具体的設定により、ローカル開発やプロトタイプ開発で実用的なコスト削減が可能。
BiNeuron: Claude Code のようなローカル・オープンソース版コード分析・生成プラットフォーム
HNBiNeuron は Claude Code に類似した機能をローカルで実現するオープンソースツール。25以上のプログラミング言語の自動検出、PDF・画像からのテキスト抽出、OCR、AI による文脈認識コード生成を統合し、ハードウェア能力に応じた最適なモデル選択を自動実行する。

Claude は英語で思考して日本語に訳しているのか。thinking の要約で検証
QiitaClaude の thinking ブロックが実際に何をしているかを、API の要約機能で検証した記事。英語で推論構造を決めた後、日本語の本文を生成する 2 段階のプロセスを確認し、英語的な言い回しが日本語文に混在する原因を解析している。