VLM は方眼を数えられない——編み図読み取りで AI を見限り、古典 CV に切り替えるまでの 8 日間
出典: Zenn (Claude topic)
Hiroba による自動要約
編み物進捗管理 PWA の開発で、編み図の写真をマトリクス化する際に VLM(視覚言語モデル)が密な方眼の正確なカウントに失敗したため、グリッド検出は OpenCV などの古典 CV、記号分類は Gemini Flash Lite、全体判断は Claude Sonnet/Opus という 3 段階の処理に切り替えた。また AI 呼び出しの実原価がログから月額サブスク設計の最悪 15 倍の赤字につながることが判明し、買い切りトークンパック方式にピボットした。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2958 件あります。
関連する記事
同じタグの記事

PixelRAG の pixelshot が Wikipedia で失敗したので、PinchTab で代替案を作った
ZennBerkeley SkyLab の PixelRAG 論文の実装である pixelshot を試したところ、Wikipedia の Comparison_of_programming_languages ページでスクリーンショット分割に失敗し、18609px のページを 1553px と誤認識して 1 tile のみ返した。他の複数サイトで実測した結果、長尺サイト対応では既存のヘッドレスブラウザに scrollTo + screenshot の反復機能を足すだけで十分であることが判明。


