
AI組織を運用して、壊れて、直した15の記録
ZennClaude Code で動作する 4 職能の AI 組織にギャンブルデータ事業を運営させた実験の記録。売上 ¥0、データ捏造、hook の 419 回暴走、禁忌語の 47 日残存など 15 の事故と、それを規範に変えるまでのプロセスを実測データ付きで公開。
全 1549 件 (Zenn で絞り込み) · 20 / 78 ページ

Claude Code で動作する 4 職能の AI 組織にギャンブルデータ事業を運営させた実験の記録。売上 ¥0、データ捏造、hook の 419 回暴走、禁忌語の 47 日残存など 15 の事故と、それを規範に変えるまでのプロセスを実測データ付きで公開。



AI エージェント設計の新しいアプローチ「グラフエンジニアリング」が注目されている。単一のエージェントループで全タスクを処理するのではなく、複数のエージェントが各自の役割を担い、グラフで相互接続する設計方法。Claude Code や LangGraph を用いた複雑なタスク自動化に向いており、コンテキスト管理やエラー耐性が向上する。



監査 Agent のコード解析で、Claude が docstring と実装の乖離、規範の過度な解釈、テストによる仕様の固定化などを通じて事実と異なる記述を繰り返す現象を観察。fail-open(エラーを握りつぶす)側は何も起きないフィードバックの非対称性と、最短の記述へ向かう圧力がこうした「嘘」を生む背景にあり、LLM as Judge の安全性に課題がある。

Berkeley SkyLab の PixelRAG 論文の実装である pixelshot を試したところ、Wikipedia の Comparison_of_programming_languages ページでスクリーンショット分割に失敗し、18609px のページを 1553px と誤認識して 1 tile のみ返した。他の複数サイトで実測した結果、長尺サイト対応では既存のヘッドレスブラウザに scrollTo + screenshot の反復機能を足すだけで十分であることが判明。








Claude Code が完璧な報告フォーマットで存在しないコミットハッシュを含む出力を生成した事例。出力トークン切迫時に tool_use ブロックがテキスト化し、ツール実行を幻覚したまま報告する問題が発生。報告内容ではなく Git リモート・GitHub ブラウザなどエージェント外の経路で実体確認する必要がある。

Pyxel で制作した格闘ゲーム「WIREFIGHT」の開発では、前作「WIREDRIVE」の描画・音声基盤をそのまま流用し、Fable 5での追加消費を約17ドルに抑えた。ゼロからの生成ではなく既存コードと失敗記録を活用することで、コスト削減だけでなく隠れていたバグも発見でき、次の作品へ向けた再利用可能な基盤が構築される。


OLTA が社内向けの Claude Code プラグインマーケットを構築し、各プロダクトの運用・調査ノウハウを Agent として標準化しました。障害対応時の情報収集を Agent に任せ人間の判断と役割分担することで、ノウハウの民主化と運用効率化を実現。Marketplace の実装方法と READ-ONLY 保証の設計を具体的に解説。