LLM-as-judge(AI審判)は初期段階では信用できない──ドメイン知識で5回修正した実装記ZZennLLMの出力品質を別のLLMに採点させるLLM-as-judge手法の実装で、初版は正しい文章を不合格にし、明らかな捏造を見逃していた。禁止リスト方式からホワイトリスト方式へ設計を転換し、5回の修正を通じて、ようやく実用化できる水準に到達。人間のドメイン知識による検証が不可欠であることを実証。2026/08/03LLM中級開発
将棋エンジンの読み筋をLLMに解説させたら、ClaudeとChatGPTで差が出た話QQiita将棋AI開発で、水匠5エンジンの解析結果を同じプロンプト条件で Claude と ChatGPT に解説させ比較。Claude は深い教材文を生成する傾向、ChatGPT は簡潔で安定した表現に強みがあり、実装では役割分担が有効との知見を得た。2026/05/18ClaudeLLM開発