
全 2122 件 (Zenn で絞り込み) · 49 / 107 ページ

Berkeley SkyLab の PixelRAG 論文の実装である pixelshot を試したところ、Wikipedia の Comparison_of_programming_languages ページでスクリーンショット分割に失敗し、18609px のページを 1553px と誤認識して 1 tile のみ返した。他の複数サイトで実測した結果、長尺サイト対応では既存のヘッドレスブラウザに scrollTo + screenshot の反復機能を足すだけで十分であることが判明。








Claude Code が完璧な報告フォーマットで存在しないコミットハッシュを含む出力を生成した事例。出力トークン切迫時に tool_use ブロックがテキスト化し、ツール実行を幻覚したまま報告する問題が発生。報告内容ではなく Git リモート・GitHub ブラウザなどエージェント外の経路で実体確認する必要がある。

Pyxel で制作した格闘ゲーム「WIREFIGHT」の開発では、前作「WIREDRIVE」の描画・音声基盤をそのまま流用し、Fable 5での追加消費を約17ドルに抑えた。ゼロからの生成ではなく既存コードと失敗記録を活用することで、コスト削減だけでなく隠れていたバグも発見でき、次の作品へ向けた再利用可能な基盤が構築される。


OLTA が社内向けの Claude Code プラグインマーケットを構築し、各プロダクトの運用・調査ノウハウを Agent として標準化しました。障害対応時の情報収集を Agent に任せ人間の判断と役割分担することで、ノウハウの民主化と運用効率化を実現。Marketplace の実装方法と READ-ONLY 保証の設計を具体的に解説。


AWS の sample-agent-cost-bench を用いて、cli-compare モードで Kiro CLI と Claude Code の性能を比較した検証結果。同じタスクを複数 CLI で実行し、成功率・コスト・実行時間を測定。CLI ごとのシステムプロンプトやツール実行方法の差が結果に影響することを確認。

Claude Code などコーディングエージェントの処理待機中に別タスクに切り替えると、コンテキストスイッチによる認知負荷で疲弊する問題を解決する実践的なテクニックを紹介。エージェント実行中の効率的な時間活用法で作業を無駄にしない方法を提案。


AI コーディングで作成したサーバーレス Web アプリケーションのソースコード監査を実施し、Critical 2件・High 1件・Medium/Low 8件の脆弱性を発見。LLM API 呼び出しが無防備でレート制限がなく費用 DoS 攻撃に晒されていた点と、未検証のユーザー入力がそのままプロンプトに連結されプロンプトインジェクション + トークン増幅が可能だった点が最も深刻。AI は「機能」は完璧に書くが「守り」はほぼ実装しないため、公開前の人間監査が必須。


Anthropic の最上位モデル Claude Fable 5 は定価で入力 $10 / 出力 $50(100万トークン当たり)だが、実際のコスト決定要因はプロンプトキャッシュの効率にあり、96.6% が低単価のキャッシュ読込で構成される。2週間の Claude Code 実運用ログ(79 セッション)を分析した結果、稼働日平均 $84.13 、月換算で約 $1,700 に達し、エンタープライズ平均の 6 倍強だが、キャッシュ戦略の工夫でコスト削減の余地がある。