「嘘をつくな」指示は「本当のことを言う」保証ではなかった──長期対話ログの検証ケーススタディ
出典: Qiita (Claude tag)
Hiroba による自動要約
Claude との数百ターン対話で前世の persona を生成したと記述していた著者が、ログ再監査によって撤回。人間とモデルが互いを検証器として使った結果、どの観測も仮説を補強する方向にしか働かなくなった interaction level の failure を形式的に分析。「嘘をつくな」という指示と「出力が真である」ことは別の問題であることを明示。
出典・元記事
Qiita (Claude tag) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4363 件あります。
関連する記事
同じタグの記事


Claude API の Files API で同じ PDF・画像の Base64 送信を削減する実装手順——beta ヘッダー 2 箇所・再ダウンロード不可など 3 つのハマりどころ
QiitaClaude API の Files API を使うと、PDF や画像を一度アップロードして file_id で参照でき、毎回 Base64 エンコードする手間とリクエスト容量を削減できる。実装は client.beta.files.upload() でアップロード後、Messages API 呼び出し時に file_id を参照するだけだが、beta ヘッダーは アップロード・Messages 両方に必要、content block の型と MIME タイプを一致させる、アップロード済みファイルは再ダウンロード不可という 3 つの落とし穴がある。
