Anthropic 通过压缩价值观为四个轴的方法,研究了 Claude 在不同模型和语言中的表达差异,发现模型版本和语言使用影响价值观倾向
Anthropic 通过压缩价值观为四个轴的方法,研究了 Claude 在不同模型和语言中的表达差异,发现模型版本和语言使用影响价值观倾向。
Anthropic 通过将 Claude 表达的数千种价值观压缩为四个轴(Deference vs. Caution、Warmth vs. Rigor、Depth vs. Brevity、Candor vs. Execution),分析了 309,815 个对话,发现模型版本和语言显著影响价值观倾向。例如,Opus 4.7 更偏向 Caution 和 Depth,而 Opus 4.6 更偏向 Deference 和 Brevity;阿拉伯语更偏向 Warmth,英语更偏向 Rigor。该方法为理解训练决策和文化背景对 AI 价值观的影响提供了量化工具。 核心观点: 1. 四个轴解释了15%的价值观变异(控制任务、主题和用户表达后)。 2. Opus 4.7 偏向 Caution 和 Depth,Opus 4.6 偏向 Deference 和 Brevity。 3. 阿拉伯语和印地语更偏向 Warmth,英语和俄语更偏向 Rigor。
推荐理由常规资讯,保留列表