プロンプト改善を「1回の満点」で判断してはいけない ─ 10回回して分かったことZZenn介護記録から情報を抽出するLLMプロンプトを、自作の評価ロジックで改善した事例。1回の実行で満点を取ったプロンプトも、10回繰り返すと不安定であることが判明。フィールドごとの重み付けと見逃し・過剰抽出の検出で、最終的に10回中10回の満点まで改善したプロセスと知見をまとめている。2026/08/03プロンプトエンジニアリング評価方法中級