同じコードを11回検査させても、そのCVEは0回だった ― LLM脆弱性検出の再現性実測
Hiroba による自動要約
事業買収プラットフォーム RIKKA M&A の技術 DD 機能において、既知の CVE を検出できない問題を調査した結果、LLM による脆弱性検出は実行ごとに結果が変動することが判明。critic モジュールを疑う誤診を経て、問題は生成側の不安定性にあること、および測定基盤の欠落(捨てた情報の未記録)が原因調査を困難にしていたことを発見。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4002 件あります。
関連する記事
同じタグの記事

脆弱性を社員自身で解消する — Defender × KQL × GAS × Claude
ZennMicrosoft Defender の脆弱性データを KQL で抽出し、GAS で社員専用ダッシュボードを構築。Claude Cowork で社員が自分の端末の脆弱性を AI と協働で解消するフローを実装。ファイルパス特定による正確な対処判定と aadDeviceId による端末突合が鍵。

Claude in Chrome が全有料プランで利用可能に—ブラウザ自動操作とプロンプトインジェクション対策を実装
Claude BlogClaude in Chrome が全有料プランで一般提供開始。各ステップの承認なしにブラウザでの自動操作が可能になり、全アクション前に安全性分類器による検証を実施。プロンプトインジェクション攻撃への防御強化により、内部ダッシュボードやレガシーシステムなど API 未対応ツールへのアクセスも安全に実現。

複数の AI モデルを役割分担させてトークン効率を改善する方法
ZennClaude を司令塔、別のモデルを実装ワーカーとして分け、要件整理・レビューと実装・修正を分離することでトークン消費を削減する手法を紹介。Claude Code に /build-loop スキルを追加し、高性能モデルの利用枠を効率化できる構成を提案。

読み取りはLLM・判定はJSに分けても見逃した——手書き帳票の異常が通知から消える2つの経路
Zenn手書き帳票をスマホで撮影してLINEで送ると異常を指摘するシステムで、Claude の vision で読み取り、Cloudflare Workers で判定する設計を採用していたが、記入された異常がルール未設定で集計外に落ちる経路と、未記入を印刷文字で誤抽出する経路の2つの見落としが発見された。対応として型を拡張し、ルール未設定時の保険機構を追加した。