実際の企業コードでAIモデルの性能を測る「Real-SWE」ベンチマーク
出典: Zenn (Claude topic)
Hiroba による自動要約
従来のSWE-benchはオープンソースコードのみを対象としているが、Real-SWEは実際の企業プライベートコードベースを使用してAIモデルを評価する新しいベンチマーク。ドメインロジック・レガシーコード混在・複雑な依存関係など実務特有の課題に対応したAIエージェントの真の能力を測定し、企業導入時の実用性判断に活用できる。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4381 件あります。
関連する記事
同じタグの記事
AI Agent の過去セッションを Go で抽象化する
Zenn複数の AI Agent に対応した CLI ツール ccsession を開発。異なるフォーマット (Claude Code と Codex の JSONL) で保存された過去セッションの履歴を統合データ構造として抽象化し、検索・再開機能を実装。

AIエージェントチーム管理の認知負荷問題:Fable 5による「Human ↔ Agent 出力契約」の設計
QiitaClaude Code による AI 駆動開発で複数エージェント運用時に人間の読む情報量が増加する問題に直面。Fable 5 に既存全エージェントチームを棚卸しさせ、出力経路を C1(チャット)C2(通知)C3(成果物)C4(Agent 間連携)の 4 種類に分類し、Agent の網羅性を維持しながら人間が読む情報だけ圧縮する「出力契約」を横断適用した事例。

AI エージェントを開発に入れて 2 ヶ月 ── 品質と説明責任をどう担保したか
QiitaClaude Code を用いた 2 ヶ月のプロジェクト運用で、品質・説明責任・暴走防止を「気をつけます」ではなく仕組みで実現した事例。機械が事実を算出し AI が判断を添え人が裁定する 3 層設計、承認ゲート・不可逆操作の人手保持・意図的な破壊テストなどにより、技術的品質と経営判断の分離を機械的に保証。ドキュメント 3 層化で全決定の経緯を追跡可能にした。
