会話履歴からの人物像推定、Claude は属性ごとに異なる閾値で断定・留保する
出典: Zenn (Claude topic)
Hiroba による自動要約
会話履歴から人物像を推定させた実験で、発言に基づく推定(慎重さ・責任感)と根拠のない推定(年齢・職種・役職)が同じ断定的な文体で出力される問題を確認。「推測と明示せよ」という指示は性別にのみ機能し、年齢・職種・役職では無視された。属性ごとに異なる留保の閾値が、RLHF訓練による属性固有の慎重さの不均一性に由来すると考察。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4389 件あります。
関連する記事
同じタグの記事


