Claude Fable 5に記事を採点させたら、外からの一言で72点が90点台に変わった
Hiroba による自動要約
Claude Fable 5 の採点能力を検証した実験。ChatGPT が書いた記事を評価軸を明示せずに採点させると 72 点、反論を見せると 90 点台に変わり、書き手を明かすと「権威で判断していた」と本人が認識。AI に採点させる際は評価軸を先に指定し、発話者の権威ではなく内容で点が動いているか検証する必要がある。
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4593 件あります。
関連する記事
同じタグの記事

40年前の博士論文を Claude と一緒に Python で動くコードに実装した話
Qiita1980年代の画像圧縮研究(差分-アダマール変換符号化)の未完成だった博士論文を、40年後に Claude を使ってPythonで再実装・検証した。当時の非適応・適応符号化、カラー画像拡張などの手法を動作確認し、歴史的な技術が現代でも有効であることを確認。

Claude Maxプラン月2万円課金で生活が変わった話──開発速度と生活のバランス
ZennClaude Proプランから Maxプランへアップグレードしたユーザーが、Claude Code による開発で月2万円の定額課金による「元を取ろう心理」に駆られ、1ヶ月で5プロジェクトを並行開発した経験を報告。得られた成果(外注なら数十万円相当のツール群、実践的なAI活用スキル)と失ったもの(睡眠時間、使わなきゃ損という強迫観念)を冷静に整理し、対策として「作りたいものリスト」の事前作成を推奨。

Claude Code用CLAUDE.mdの設計パターン集 ── 7つのプロジェクト類型別テンプレートと最適化の原則
QiitaClaude Codeの出力品質はCLAUDE.mdの設計で決まり、プロジェクト類型に合わないテンプレートは逆効果になる。本記事は API開発・フロントエンド・データパイプラインなど7つの類型ごとに最適化されたテンプレート、トークン効率を考慮した構造設計(300~800語の目安)、および実装時のアンチパターン5つを解説し、段階的な運用フローまで提供する。

OpenMontage で動画制作を自動化――ローカル LLM での実装検証
ZennOpenMontage は Claude Code・Cursor 等の AI エージェントに動画制作全工程を任せるオープンソースシステム。12 のパイプライン・122 のツール・700+ のスキルで構成され、Piper・LTX・WAN 等のローカルモデルで無料完結が可能。本記事は実装者が cinematic パイプラインでローカル環境を構築した際に遭遇したドキュメント実装の食い違いと対処法を記録。