
プロンプト改善を「1回の満点」で判断してはいけない ─ 10回回して分かったこと
Zenn介護記録から情報を抽出するLLMプロンプトを、自作の評価ロジックで改善した事例。1回の実行で満点を取ったプロンプトも、10回繰り返すと不安定であることが判明。フィールドごとの重み付けと見逃し・過剰抽出の検出で、最終的に10回中10回の満点まで改善したプロセスと知見をまとめている。
全 4026 件 · 43 / 202 ページ

介護記録から情報を抽出するLLMプロンプトを、自作の評価ロジックで改善した事例。1回の実行で満点を取ったプロンプトも、10回繰り返すと不安定であることが判明。フィールドごとの重み付けと見逃し・過剰抽出の検出で、最終的に10回中10回の満点まで改善したプロセスと知見をまとめている。

Claude Code の最新の進化が AI 開発能力の現在地を示す重要な指標であることを指摘した記事。実際に Claude Code を使うことで、現在の AI がどの程度のコード生成・修正タスクに対応できるかを体験できる。AI の実力を正しく評価するには、ツールの実践利用が不可欠という主張。
Reddit ユーザーが Claude を使用して GTA 6 風のゲーム実装に初挑戦した結果を報告。Agent ループと適切なツール連携により、完全ではないが実用的なゲームロジックを自動生成できたことを実証。Claude の agentic 能力の実践例として注目される。


GitHub Actions と Claude Code CLI を組み合わせ、Issue に実装内容と @claude を記載するだけで、自動的にブランチ作成・実装・PR 作成が行われるワークフローを構築。API キー登録、GitHub Actions ワークフローファイル作成、安全網スクリプト設置の 3 ステップで実現でき、マージ判断は人間が行う。


Claude Code の Skills 機構とサブエージェント機能を組み合わせ、CEO・CFO・CTO・COO・CMO の経営職と補助エージェント 4 体で構成した 9 体の「AI 経営 OS」を OpenClaw プラグイン基盤上に実装。各エージェントが独立したツール権限と責務を持ち、CEO レイヤーが他職能の報告を集約する設計で、朝のダッシュボード自動生成やタスクルーティングなど日常業務の自動化を実現している。
2026年8月3日に Claude Sonnet 5 でパフォーマンス低下が発生し、Reddit の r/ClaudeAI コミュニティで情報共有と議論が行われている。ユーザーはレスポンス遅延や応答品質の低下を報告しており、Anthropic による対応状況の更新が注視されている。


Claude のチャット、Claude Code、API の 3 つの利用場所には、メモリ・過去チャット検索・オートメモリ・Memory Tool など 6 つの独立した保存・検索の仕組みが存在し、相互に自動共有されない。プロジェクトは記憶の境界になり、通常チャット・プロジェクトメモリ・Claude Code の各領域は分離されている。


Anthropic の Claude Code 責任者 Boris Cherny が、Claude Tag を使って Electron で構築された Claude デスクトップアプリを Swift でネイティブに書き換える実験を進行中。GitHub 上の Mac 仮想マシンで実行を続けており、既に 14~15 日経過。検証(verification)をプロンプトに組み込むことが困難なタスク達成の鍵であると指摘。

Anthropic 関連のニュースをまとめた索引記事。Claude のテスト環境の安全性問題、モデル配布ポリシーの一貫性、仕様による誤解、隠しタグの発見、本人確認の手法、複数 Agent の役割分担、PRD から eval suite への転換など、開発者が知るべき8つのトピックを紹介している。

2026年6月にリリースされた最上位モデル Claude Fable 5 について、Opus 5・Sonnet 5・Haiku 4.5 との仕様・価格・機能面での比較、および1ヶ月の実運用に基づく各モデルの使い分けポイントをまとめた記事。思考(thinking)機構の違いや fast mode・高解像度画像対応など機能差、定額プランでの提供状況の変遷も詳説。