Claude の内部思考を読む J-lens:Anthropic の解釈可能性研究が示す監視の新手法
Hiroba による自動要約
Anthropic が公開した J-lens は、Claude の出力より先に内部活性から「言葉にできる概念」を直接読み出す技術。ヤコビアン行列を用いてモデルの各レイヤーで「どの単語を言いやすくするか」を測定し、エージェントの隠れた意図や不正検知を出力の段階で捉えることが可能になった。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 2892 件あります。
関連する記事
同じタグの記事

Claude Code 環境をスタートアップリポジトリで統一し、RTK・Lean-CTX によるトークン削減を実装する
Qiita複数環境での Claude Code セットアップの手間を削減するため、スタートアップリポジトリを構築し、RTK・Lean-CTX などのトークン削減ツールを自動導入する方法を解説。RTK 導入後、実務環境で 3.2% のトークン削減率を実現したが、出力圧縮による意図しない動作変化に対応する運用上の注意が必要。

Claude Code が入力前に送る 38,000 トークンの実際の支払いを測定
QiitaClaude Code はユーザー入力前にシステムプロンプトとツール定義で 38,000 トークンを API に送信しており、プロンプトキャッシュの効果を含めた実際の課金額を、自作リバースプロキシで計測した。初回リクエストのキャッシュ書き込み費用、ターン重ねたときの単価低下、キャッシュ無効化時の再課金条件を数値で検証し、API 従量課金利用時の実害を示す。
OpenCodex: Codex と Claude Code で複数の LLM を使用可能にするプロキシ
HNOpenCodex は、Codex CLI/App/SDK および Claude Code で OpenAI Codex API を任意の LLM プロバイダー (Claude、Gemini、DeepSeek、Ollama など) に転送するローカルプロキシツール。ストリーミング・ツール呼び出し・推論トークンに対応し、複数の ChatGPT アカウント管理と自動フェイルオーバー機能を備える。
Ravenspire – Claude Code と Codex エージェントを JRPG として監視
HNClaude Code と OpenAI Codex セッションを JRPG 風のビジュアルで監視・制御するツール。各エージェントをピクセルアートのキャラクターとして表示し、タスクをクエスト、tool call を戦闘として可視化。コスト・労働時間・応答時間の分析パネルを備え、複数エージェント並行運用時の状態把握と意識向上を実現。