Vision LLM に文字を読ませると、自信を持って間違える
Hiroba による自動要約
PDF スキャンを Markdown に変換するツール scan2md を通じ、Claude 3 モデルとローカル LLM 5 種類の読み取り精度を比較した。読めない文字を {{…}} で囲む指示を与えると、囲みが少ないモデルほど実は誤読を黙って補正していることが判明。囲みの数はモデルの正確性を示さず、むしろ自信の有無を反映するため、本文全体との照合が不可欠。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4021 件あります。
関連する記事
同じタグの記事

Claude Certified Developer – Foundations (CCDV-F) 合格体験記:CCAO-F との違いと受験のポイント
Zenn著者が CCDV-F に合格した体験をもとに、CCAO-F との試験設計の違いを分析。CCDV-F は開発者向けで「Applications and Integration」が 33% を占め、技術的な正誤判断が重視される。英語のニュアンス読み分けより技術理解が結果を左右し、実務経験が最大の対策となる点が特徴。

脆弱性を社員自身で解消する — Defender × KQL × GAS × Claude
ZennMicrosoft Defender の脆弱性データを KQL で抽出し、GAS で社員専用ダッシュボードを構築。Claude Cowork で社員が自分の端末の脆弱性を AI と協働で解消するフローを実装。ファイルパス特定による正確な対処判定と aadDeviceId による端末突合が鍵。

Claude in Chrome が全有料プランで利用可能に—ブラウザ自動操作とプロンプトインジェクション対策を実装
Claude BlogClaude in Chrome が全有料プランで一般提供開始。各ステップの承認なしにブラウザでの自動操作が可能になり、全アクション前に安全性分類器による検証を実施。プロンプトインジェクション攻撃への防御強化により、内部ダッシュボードやレガシーシステムなど API 未対応ツールへのアクセスも安全に実現。

複数の AI モデルを役割分担させてトークン効率を改善する方法
ZennClaude を司令塔、別のモデルを実装ワーカーとして分け、要件整理・レビューと実装・修正を分離することでトークン消費を削減する手法を紹介。Claude Code に /build-loop スキルを追加し、高性能モデルの利用枠を効率化できる構成を提案。