同じコードを11回検査させても、そのCVEは0回だった ― LLM脆弱性検出の再現性実測
Hiroba による自動要約
事業買収プラットフォーム RIKKA M&A の技術 DD 機能において、既知の CVE を検出できない問題を調査した結果、LLM による脆弱性検出は実行ごとに結果が変動することが判明。critic モジュールを疑う誤診を経て、問題は生成側の不安定性にあること、および測定基盤の欠落(捨てた情報の未記録)が原因調査を困難にしていたことを発見。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 3253 件あります。
関連する記事
同じタグの記事

Claude Opus 5 と ChatGPT Voice で変わる AI エージェント活用の勘所
QiitaClaude Opus 5、ChatGPT Voice、Codex のエージェント機能拡張をまとめた解説。Claude Opus 5 は高性能だが冗長性の課題があり、ChatGPT Voice はマルチスレッド管理・画面認識に対応、Codex では詳細指示を避ける「under-prompting」が推奨される。モデル選定・プロンプト設計・音声インターフェース・CI/CD 組み込みの実務パターンを紹介。

Claude Codeがセッション間でメッセージ通信に対応。複数AI並列開発の人間による仲介が不要に
QiitaClaude Codeに Cross-session messaging が導入され、複数セッション間でAI同士が直接情報を共有できるようになりました。従来は人間が各セッション間の情報をコピー&ペーストする必要がありましたが、ListAgents と SendMessage により効率化が実現。トークン消費も削減され、複数AI による協調開発が現実的になります。

Claude Code: 8月14日からauto modeがデフォルト権限モードに
HN8月14日より、Claude Code の Pro/Max/Team ユーザー向けに auto mode がデフォルト権限モードに変更される。Auto mode は独立した分類器でシェルコマンドと実行を審査し、テストで危険コマンドの89%を検出。Manual approval よりも安全性で勝り、長時間実行タスクの実行性を向上させる。Classifier のオーバーヘッドはプランの使用量制限に含まれなくなる。

Anthropic と OpenAI の AWS 活用最新動向まとめ
Qiita2026年5月に Claude Platform on AWS が、6月に Amazon Bedrock 上で GPT-5.5 / GPT-5.4 が一般提供開始。Claude Platform on AWS は IAM・CloudTrail・AWSの請求管理と組み合わせて利用でき、Amazon Bedrock ではセキュリティ・ガバナンス・運用管理を統合したモデル利用やエージェント開発が可能。企業導入ではモデル性能以外に認証設計・監査・データ保存・予算管理など多角的な検討が必須。