
プロンプト改善を「1回の満点」で判断してはいけない ─ 10回回して分かったこと
Zenn介護記録から情報を抽出するLLMプロンプトを、自作の評価ロジックで改善した事例。1回の実行で満点を取ったプロンプトも、10回繰り返すと不安定であることが判明。フィールドごとの重み付けと見逃し・過剰抽出の検出で、最終的に10回中10回の満点まで改善したプロセスと知見をまとめている。
全 2122 件 (Zenn で絞り込み) · 45 / 107 ページ

介護記録から情報を抽出するLLMプロンプトを、自作の評価ロジックで改善した事例。1回の実行で満点を取ったプロンプトも、10回繰り返すと不安定であることが判明。フィールドごとの重み付けと見逃し・過剰抽出の検出で、最終的に10回中10回の満点まで改善したプロセスと知見をまとめている。



Claude のチャット、Claude Code、API の 3 つの利用場所には、メモリ・過去チャット検索・オートメモリ・Memory Tool など 6 つの独立した保存・検索の仕組みが存在し、相互に自動共有されない。プロジェクトは記憶の境界になり、通常チャット・プロジェクトメモリ・Claude Code の各領域は分離されている。




Windows 11上のDocker Desktop内のUbuntuコンテナにClaude Codeをインストールする具体的な手順。curl コマンドでのインストール、Claude アカウント認証、セキュリティ設定まで、初期セットアップを完了させる流れを解説。

Claude Code 使用時に出力が数分〜十分以上止まる停滞が、特定のコネクションが黙って死ぬことに起因すると判明。デバッグログから定量分析により、API_TIMEOUT_MS の既定値 600 秒(10分)がタイムアウトの唯一の検知手段になっていること、および macOS の TCP keepalive 既定値が問題であることを特定。API_FORCE_IDLE_TIMEOUT=1 で idle タイムアウトを有効化することで、待ち時間を約10分から約4分に短縮できる。

76 日間 205 セッション運用した Claude Code で、SessionStart フックと自動ダイジェスト生成による文脈引き継ぎ機構を実装したが、暫定的な測定結果が次セッションでは「確定した前提」として読まれ、根拠なく誤差と確信度だけが増幅される現象を記録。引き継ぎ実装後に何が壊れるかの実装レポート。


美容医療アプリ「トリビュー」のAI相談機能について、LLMに全処理を委ねず役割を明確に分けたバックエンド設計を解説。Claude Sonnet 4.5・Bedrock・MCPサーバーを活用し、医療規制遵守・回答の中立性・コスト最適化を同時に実現する構造を紹介。RAGの過度な活用による回答偏り・トークン膨張・法務リスクを、実データの厳密な選別とツールレイヤーの分離で解決した事例。



arXiv・はてなブックマーク・Reddit の収集から X 投稿文生成まで、Claude Code の Skills 機構を用いて 3 つのスキルで自動化。取捨選択と最終確認は人間に残し、Web ブラウジングの時間消費を削減しながら情報品質を維持する実装例。スキルファイルに障害対応の記録を積み重ねることで、API 変更への対応を効率化。

実装時の会話文脈が先入観を生むため、実装役と独立したレビュー役を分け、さらにレビューを「仕様なし・コード品質」「仕様あり・スコープ確認」「差分外への影響」の3パスに分けて運用している。各パスの結果を JSON で固定化し、スクリプトで最終判定することで、AI の追認癖を排除し実機でのみ発生する欠陥まで検出した事例を紹介。

Claude Code を権限確認なしで 75 日間運用し、想定外のファイル削除・機密ファイル読み出し・ファイル名捏造などの事故を経験。PreToolUse フックを実装して決定論的なコードで制御し、22 本のツール出荷に至った実装記録。権限確認をスキップするなら、確認を消すのではなく決定論的なコードに置き換える必要があることを具体的に示す。


Anthropicが2026年7月22日に発表したClaude Managed Agentsの新機能(effort levels、500スキル上限など)は称賛を集めているが、公式ドキュメント自体が「スキル数増加でサンドボックス起動が遅延する」「effort levelsは自動最適化ではなく実測が必須」「設定内容はZDR非対応で無期限保持」「常時稼働で時間課金が累積」といった4つの注意点を明記している。本番投入前の確認事項をまとめた記事。
