Claude・GPT・Geminiが医療現場で72%失敗—CHI-Benchが示すAIエージェントの現実
Hiroba による自動要約
actAVA.aiが発表したCHI-Benchは、75種類の実際の医療ワークフローを再現するベンチマークで、Claude Opus 4.6を含む30のAIエージェントの成功率は28%以下だった。連続処理では96%以上が失敗し、AI同士の連携では成功率0%。医療現場でのAI代替導入は現段階では危険性が高い。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 3946 件あります。
関連する記事
同じタグの記事

自作AIベンチマークの続き — 最新の小さいモデルが、古い大きいモデルの12倍だった
Zenn独学エンジニアが7種類のAIモデルに落ちものパズル課題を実行させ、同じ採点プログラムで比較。Claude Opus 5・Gemini 3.7 Flash・GPT-OSS など複数環境で計測した結果、Gemini 3.7 Flash が前世代比で約35%性能向上し、環境依存性が最小限であることを確認。実験設計の穴(モデルが繰り返し同じ答えを見ていた事例)も発見。

SES脱出を目指すエンジニアのためのAI開発ツール実践ガイド2026
QiitaSES常駐で単価が上がらない壁に直面するエンジニア向けに、Claude Codeを中心としたAI開発ツールの実務的な使い方と、個人開発で収益源を構築するステップを具体的に解説。ツール使い分け、自動化フロー、MVP構築、ポートフォリオ作成の4つの実践パターンを提示し、フリーランス転向の武器化を支援する。

月商250万円、社員3人でAI経営OSを作った話——Claude Codeで CFO/COO/CMO を実装
Qiita月商250万円・社員3人の小規模企業が、Claude Code のサブエージェントと Skills を活用して、財務(CFO)・営業管理(COO)・マーケティング(CMO)の役職ごとにスコープを分離したエージェントを構築。freee 連携による財務分析、営業パイプライン管理、GA4 統合ダッシュボードなどを実装し、月末締めに依存しない経営判断基盤を実現した事例。APIコスト制御、プロセス監視、エージェント間の情報整合性チェックなど実装時の課題と対応策も共有。

価格競争から降りる — 1日10本のAIセッションが支える AI ネイティブ開発ワークフロー
Zenn会員管理・予約決済システムの SaaS を運営する企業が、値下げ合戦ではなく顧客ニーズに応じた機能開発で差別化を図る事業戦略を紹介。要望対応・土台整備・緊急対応の 3 枠バランスと Claude Code による AI エージェント活用で、1 日 10 本のセッションを当日中にリリースする開発ワークフローの実装例。