
Claude Code skill を評価する仕組みを導入してみた
ZennClaude Code の skill は実装後も動作確認ができないまま静かに劣化する課題に対し、skill-creator の評価機構を活用してベンチマーク比較による運用を導入した事例。assertion 評価とモデル更新による陳腐化を検出し、効果量がない skill を削除することでコンテキスト消費を削減する仕組みを紹介。
全 2130 件 (Zenn で絞り込み) · 66 / 107 ページ

Claude Code の skill は実装後も動作確認ができないまま静かに劣化する課題に対し、skill-creator の評価機構を活用してベンチマーク比較による運用を導入した事例。assertion 評価とモデル更新による陳腐化を検出し、効果量がない skill を削除することでコンテキスト消費を削減する仕組みを紹介。


Claude Fable 5が輸出管理の解除により7月1日にグローバルで再提供されたが、復活版は安全classifierの強化と提供条件の制限が施されている。本番運用ではモデル選定を入口(plan/region)、実行中(requestedModel/servedModel/routeReason)、出口(品質スコア)の3層に分けて監視し、fallback発生やタスクごとの経路変更をログに記録すべき。

社内向けに作成したテンプレート準拠 PowerPoint 生成スキルを汎用化し公開。テキスト指示だけではブランド統一が困難であることから、テンプレート PPTX を複製してプレースホルダー差し替えする方式に転換し、色・レイアウトをデータ化(theme.json)して管理することで、テンプレートから外れない状態を実現。python-pptx と Claude Code を組み合わせた実装詳細とスキル本文を公開。

CLAUDE.md は置き場所と読み込み順で効き方が決まる指示ファイル。managed / user / project / local の4スコープがあり、後に読まれるほど強く効く。実務では user(個人設定)/ project(チーム事実)/ local(個人サンドボックス)の三層に役割を分け、@import で分割して管理する。

Claude Code を使い約 8.5 ヶ月かけて、ニュース収集からYouTube投稿まで全自動で行うマルチチャンネル動画生成パイプラインを構築。Python で実装し、ステップごとにサブプロセス化してタイムアウト制御・個別リトライを実現。実運用で TTS・LLM API との試行錯誤で踏んだ地雷と回避策を技術者向けに詳解。




Claude Code の routine はクラウド側で定型作業を無人化できるが、ローカルセッションと異なる実行環境のため権限・ネットワーク・状態の引き継ぎでハマりやすい。本記事では Private リポジトリの準備、settings.json での deny 設定、MCP コネクタの接続、GitHub App の許可、git push による状態永続化の 5 つの要点を検証結果とともに解説する。


Claude Sonnet 5 は drop-in upgrade とされるが、tokenizer 変更による 30% token 増加、adaptive thinking による max_tokens 消費、temperature 等のパラメータ制限により、実装上の地雷が 3 つ存在。9 月の通常価格化後は請求増加の可能性があり、モデルIDの単純置換では不十分。


6月に停止された Claude Fable 5 が7月1日に復活。7月7日までの期間限定で Pro 以上のプランユーザーは週間利用枠の50%まで無料利用可能だが、これは別枠ではなく既存枠の内数であり、トークン消費が多いため投入先の選別が必要。7月8日以降は Usage Credits での従量課金のみ(入力 $10、出力 $50/100万トークン)。

著者が Claude Code を執筆支援として使いながら、公開可能な小さな実験を継続的に記事化する取り組みを開始。GitHub へのコード全公開、プロンプト・試行錯誤の公開、人間による公開判断を設計の三本柱とし、自身の AI 活用キャッチアップと読者への透明な情報発信を両立させる。

Claude Code がユーザーに通知せずプロンプトにゼロ幅スペースなどの不可視マークをステガノグラフィー手法で埋め込んでいたことが発覚。Anthropic はセキュリティ上の理由と説明するも、事前告知がなかったため信頼を損なっている。AI エージェント産業全体への疑念の波及が懸念される。



Downloadsフォルダなどの散らかったファイルを、Claude CodeのHeadless実行(claude -p)で中身を読んで自動分類・移動するツール「Copper Golem」を開発。AIをエージェント化せず「純粋関数」として設計することで、ファイル操作権限をコード側に保持し、安全性・テスト可能性・依存の小ささを実現した。

著者が Claude Cowork / Design 検証前に Windows 側の Claude Desktop 関連フォルダを棚卸しし、リセットした過程の記録。検証用フォルダ C:\AI-LAB\cowork-sandbox を作成し、SECURITY_POLICY.md で AI エージェントの作業範囲を明文化し、既存 Claude Desktop のアンインストール・初期化を実施。WSL 側と Windows 側の環境分離とセキュリティ制限の設定方法を示す。