ローカル LLM の感情知能を測る — EQ-Bench 3 で Qwen3.5-122B(int4) をベンチマーク
Hiroba による自動要約
感情知能(EQ)に特化したベンチマーク EQ-Bench 3 の設計と評価方法を解説し、ローカル LLM(Qwen3.5-122B-int4)での実測結果を報告。マルチターンロールプレイと心理分析タスクで、モデル間の差を識別する 45 問のシナリオから、対人状況での適切な対応能力を測定。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4744 件あります。
関連する記事
同じタグの記事

Claude Opus 5.5は Effort によってどのように性能が変わるのか【godot-llm-gamebench】
ZennClaude Opus 5.5の子エージェント(実装外注先)として5段階の effort を検証したベンチマーク。high と xhigh が平均 100.00 で首位だが、high は 3.3 分・$1.09 で済むのに対し xhigh は 9.6 分・$2.11 かかる。gpt-6.1-sol との比較では Opus は 15 回中 11 回の満点達成、medium は low 以外で安定した結果を示した。

Next.js 16 + Supabase + Claude API で AI学習 SaaS を 2 日で作った話
ZennCodeSensei(ユーザーのコードを教材にする AI 学習プラットフォーム)を 2 日間で構築した個人開発事例。Next.js 16、Supabase、Claude API を組み合わせ、15 コース・188 レッスン・95 冊の技術書知識を内蔵し、GitHub リポジトリや手動ペースト したコードを題材に Claude が技術概念を解説。実装スケジュール、技術選定基準、プロンプト階層化によるコスト削減、著作権対応の設計判断を詳細に共有。

「Vibe Coding」はもう卒業!プラグイン「Superpowers」でClaude Codeに開発SOP を導入する
QiitaClaude Code で AI がいきなりコードを書く「Vibe Coding」の問題を解決するオープンソースプラグイン「Superpowers」を紹介。仕様の明確化・設計・テスト駆動開発・レビューを強制する 7 フェーズパイプラインにより、手戻りの削減と品質の安定化を実現する。
