Vision LLM に文字を読ませると、自信を持って間違える
Hiroba による自動要約
PDF スキャンを Markdown に変換するツール scan2md を通じ、Claude 3 モデルとローカル LLM 5 種類の読み取り精度を比較した。読めない文字を {{…}} で囲む指示を与えると、囲みが少ないモデルほど実は誤読を黙って補正していることが判明。囲みの数はモデルの正確性を示さず、むしろ自信の有無を反映するため、本文全体との照合が不可欠。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4298 件あります。
関連する記事
同じタグの記事

複数AI(Claude / Cursor / Antigravity / ChatGPT)を Obsidian シンボリックリンクで完全同期する Single Source of Truth 構築
Qiita複数のAIツール間でプロンプト・知識ベースの二重管理を避けるため、Obsidian Vault を原本として、シンボリックリンク(ln -s)で Claude Code・Cursor・Antigravity 等を 0 秒自動同期する仕組みを構築。profile.md・domain.md・ng-rules.md など 7 つの構造化ファイルと過去 6,600 本のブログ記事から抽出した文体パターンを注入し、AIごとのモード自動切替(僕氏モード・編集部モード・プロマーケターモード)を実装。

Claude Fable 5.1 移行時はプロンプト追記だけでは足りない。既存エージェントの実装チェックリスト
ZennClaude Fable 5.1 へ既存エージェントを移行する際、モデルID とシステムプロンプトの変更だけでは API 互換性と会話継続性の問題が残る。thinking 設定、tool_choice 指定、メッセージ履歴管理、UI 層など四層に分けた実装チェックが必須。API 設定→会話ハーネス→プロンプト→Evals の順で修正し、新モデル上で再評価する必要がある。

Claude Code 2.1.258 で fable エイリアスの解決先とコスト内訳を実測
QiitaClaude Code 2.1.258 環境で `--model fable` が claude-fable-5-1 に解決されることを `--output-format json` で確認。1回の実行で両モデルが動作し、キャッシュ書き込みが主要コストとなる実測値から、Fable 5.1 のキャッシュ読み単価引き下げの効果範囲を逆算。エイリアス基準の運用ルールを組むエンジニア向けに、世代交代検知の具体的方法を提示。

実装で比較するAIコーディングツール2026:Claude Code・Copilot・Cursor・Windsurf・CodeiumをTier別に検証
QiitaClaude Code、GitHub Copilot、Cursor、Windsurf、Codeiumの5つのAIコーディングツールを、エージェント能力・ワークフロー統合度・コンテキスト理解力など5つの軸でTier分類し、実際のセットアップコマンド・設定ファイル・CI連携サンプルコードを示した実装寄りの比較記事。2026年の業界再編(Codeium→Windsurf統合、Cognition社買収)を背景に、機能一覧だけでなく実務判断に必要な検証情報を提供。