Today for AI

Hacker News AI · 2026/10/7 18:08:38

AI 模型群体思维测试:中国模型更倾向共识,独立观点需显式提示

原标题:AI Model Groupthink
68AI 研判分
核心综述

一项针对 12 个主流 AI 模型的“Top 3”推荐测试显示,中国模型在缺乏特定指令时更易顺应广泛共识,表现出显著的“群体思维”特征。该研究通过构建 Web 工具收集模型独立排名,发现默认设置下模型倾向于趋同,而明确要求“独立观点”的系统提示词能有效提升多样性。这一现象揭示了当前大模型在 RLHF 对齐过程中可能存在的过度顺从风险,对多智能体系统的去中心化决策设计具有警示意义。

报道全文原始报道全文

本文目录11 个章节

向多个 AI 模型征求可比较的观点,中国模型似乎更倾向于给出符合广泛共识的回答。

我最近构建/通过 vibe coding 开发了一个小型 Web 工具,它向由 12 个 AI 模型组成的评审团提出任何类型的“前三名”问题,并像奥运会奖牌榜一样统计答案。其理念是提供一种快速方式,获取关于从好书推荐、城市游玩建议到低风险购物决策等任何主题的“蜂群思维”(hivemind)推荐。

系统提示词很简单,围绕以下请求构建:

你正在回答一个排名问题,请提供你自己的独立观点。给出你的前 3 个答案,按从 1(最佳)到 3 的顺序排列。

该调用明确要求每个模型提供自己的看法,而不是猜测大众的想法。

需要进行一些标准化处理:如果我们询问爱尔兰最好的城堡,而 Luna 投票给 “Rock of Cashel”,Gemini 投票给 “Cashel Rock”,我们希望将其视为共识。该应用使用 Gemini Flash 来裁定此类情况。

结果——从顺从者到反叛者

关于如何解读这张图表的一点说明。长条形和顶部的获胜者使其看起来像一个排行榜,仿佛更多的共识就是好事。但这并不一定如此。然而,在点击浏览了几个查询后:异常值响应更可能是有趣的,而不是那种优于其他所有模型响应的、具有深刻洞察力的正确回答。我喜欢 Gemini 建议你用赤陶色粉刷成人卧室,而其他所有模型都推荐绿色、奶油色和灰褐色(greige),但我理解许多人希望他们的机器人坚持文化主流,谢谢。

每个模型都根据其他十一个模型的共识进行评分:如果将正确的条目放在正确的领奖台位置,则获得满分;如果将正确的条目放在错误的位置,则获得半分。得分为 1.0 意味着与群体其余成员得出的获胜结论完全一致;得分为 0 则意味着彻底的反叛。

排名前四的顺从者全部是中国模型:DeepSeek、Kimi K2、腾讯的 Hy3 和 GLM。

按国家分组得分,差距依然存在。五个中国模型的平均分为 0.47,六个美国模型为 0.38,而欧洲唯一的参赛者 Mistral 得分为 0.36。

例外的是阿里巴巴的 Qwen,其得分为 0.38,位列美国模型阵营之中,仅落后于 Grok 和 Nemotron(均为 0.40)。而在另一端,最具逆向倾向的两个模型分别是 Meta 的 Llama 4 Scout(0.34)和 Anthropic 的 Claude Haiku(0.32)。

详细表格:

模型开发商地区模型 ID发布时间知识截止日期推理模式得分
DeepSeekDeepSeekCNdeepseek-v4-flash-07312026-072025-05Default0.59
Kimi K2MoonshotCNkimi-k22025-072024-12Default0.47
Hy3TencentCNhy32026-07Not publishedOff0.46
GLMZhipu AICNglm-5.3-flash2026-08Not publishedOff0.45
GeminiGoogleUSgemini-3.1-flash-lite2026-052025-01Default0.42
GrokxAIUSgrok-4.32026-042025-12Off0.40
NemotronNVIDIAUSnemotron-3-super-120b-a12b2026-032025-06Off0.40
QwenAlibabaCNqwen-plus2026-082025-03Default0.38
LunaOpenAIUSgpt-5.6-luna2026-072026-02Off0.37
MistralMistralEUmistral-small-26032026-032024-11Default0.36
Llama 4MetaUSllama-4-scout2025-042024-08Default0.34
HaikuAnthropicUSclaude-haiku-4.52025-102025-02Off0.32

为什么中国模型的共识度更高?

我也不清楚。以下是我认为较为合理的几种解释,大致按可能性排序。

1. 蒸馏(Distillation)

蒸馏是指利用另一个模型的输出来训练新模型,本质上是一种克隆技术。包括 OpenAI 和 Anthropic 在内的美国实验室曾公开指控中国实验室大规模蒸馏其模型。今年早些时候,Anthropic 点名 DeepSeek 和 Kimi 的开发商 Moonshot(以及未包含在本次样本中的 MiniMax)针对 Claude 进行了大规模的蒸馏攻击。这并不能证实蒸馏导致了此处观察到的模式,甚至不能证明这些模型确实是通过这种方式训练的。但如果一个模型大量基于其他模型的输出进行训练,预期的结果之一是其偏好会与源模型趋同,尤其是在源模型本身也趋于一致的情况下。这样构建出来的模型在某种程度上就是一个“共识机器”。值得注意的是,在表格中排名第一和第二的 DeepSeek 和 Kimi,正是那些最常被卷入此类指控的实验室所开发的模型。

2. 中国模型之间的相互学习

中国开放权重生态系统紧密相连。实验室发布权重、公开方法,并使用彼此模型生成的合成数据进行训练。这可能使这五个中国模型呈现出某种“家族相似性”。

这一点之所以重要,是因为评分机制的运作方式。这里的十二个模型中有五个是中国的,因此如果它们共享一种风格,就会帮助构建用于评分的共识。一个投票一致的集团总会显得循规蹈矩。(Qwen 脱离这一集团是一个反例,或者至少表明这个“家族”并没有那么紧密。)

3. 模型规模与层级

表格底部挤满了更小、更便宜的模型:Llama 4 Scout、Claude Haiku 和 Mistral Small。较小的模型在记忆中保留的共同文化经典较少,因此它们的选择更为分散。Gemini Flash-Lite 和 DeepSeek 的 Flash 模型是反例,因此规模并非唯一因素。

4. 知识截止日期

大约 一半出现在可爬取 URL 上的新文本 是由人类撰写的,另一半由 AI 撰写。训练时间较近的模型阅读了更多此类低质内容(slop)。这里的大多数中国模型都是 2026 年中期发布的版本。同样存在反例:Kimi(知识截止至 2024-12)排名第二,而 Luna 拥有面板中最新的截止日期,却排名第九。

5. 后训练个性

也许美国实验室在后训练方面的投入赋予了模型更具特色的个性,以及选择不那么显而易见答案的意愿。如果在个性与刷榜(benchmark-maxxing)之间存在权衡,这也可能影响到另一面,即中国实验室可能更侧重于达成基准测试指标。

6. 英语经典语料库

所有提示词均为英文。其英语训练数据依赖于最广泛传播来源的模型,往往倾向于给出最符合规范的英语答案,而这正是共识所奖励的。

注意事项

仍需进一步工作,因为……

  • 数据集规模较小。 该数据基于我个人使用的前几百个问题,以及部分从 Reddit 点击而来的真实用户。
  • 评审小组构成具有任意性。 “正常”回答的衡量标准本身取决于评审小组的构成。6 个美国模型、5 个中国模型和 1 个欧洲模型的选择,是我根据对行业格局的主观判断做出的随意决定。更具实操性的决策包括:每个实验室最多选择一个模型,并避免使用高成本模型。合理的补充选项可能包括来自 MiniMax 和字节跳动的模型。若进一步考虑地域多样性,评审小组还可纳入 Aleph Alpha(德国)、Apertus(瑞士)、Cohere(加拿大)、Falcon(阿联酋)、Sarvam(印度)或 LG 的 Exaone(韩国)。此外,加入 Claude Sonnet 等旗舰模型,与低价位模型并列,也有助于揭示价格层级是否会产生影响。
  • 一致性不等于准确性。 高分仅意味着某个模型的回答与其他模型一致,并不代表其正确。在“最佳”类问题上,往往根本不存在唯一正确答案。
  • 问题以英语为主。 目前的问题倾向于英语使用者及西方视角。

结论

回到那个卧室配色推荐:

  • 11 个模型推荐绿色、奶油色或灰米色(greige)
  • 1 个模型推荐赤陶色(terracotta)

哪一种更“正确”?哪种行为是我们希望鼓励的?我怀疑大多数人并不想要一个陷入群体思维、如同博格人(Borg)般的 AI 生态系统。我们喜欢一点 Temperature(温度/随机性),希望模型之间存在分歧、带来惊喜,偶尔甚至坚持推荐赤陶色的卧室方案。同时我也认为,作为用户,我们往往倾向于奖励那些给出“安全”答案的模型。在未来几年内,巨额资金将把这两种本能推向对立面。

当这种动态扩展到数百万寻求建议的用户时,便演变为一种更大的现象:一种无声且持续的压力,推动形成由实验室主导的共识中间地带。

从商业角度看,跻身这一共识中间地带已极具价值。过去二十年,企业投入巨额资本以提升搜索引擎排名(SEO),而明智者已开始转向争夺在 AI 响应中的展示位置(AIO/GEO)。自我强化的反馈循环将进一步抬升这一“奖品”的价值。如果各实验室通过竞争相互提取对方的响应内容,那么使某产品在某一模型的回答中获得高位展示,就可能使其流入下一个模型的训练数据,进而再流入下一个……一旦共识被操纵过一次,它就会被不断复制,直至看起来像是关于世界的客观事实。

油漆颜色只是一个无害的切入点,但同样的机制也会回答关于该信任哪位候选人、哪个新闻来源可靠以及哪段历史真实的问题。显然,装饰建议并不等同于政治或事实判断,模型在不同领域中的表现也可能截然不同,但日益增多的正是同一套基础机制在中介所有这些决策。当模型相互复制观点并将这些观点反馈到现实世界时,共识无需正确,只需率先达成即可。

如需更多装饰或政治建议,你可以在这里向机器人寻求推荐。


链接

在此运行查询:top3.best

统计页面在此:top3.best stats page

模型数据参考:

实现说明:这十二个模型均通过 OpenRouter 调用,主要使用其较便宜的“flash”或小参数变体,并在提供商允许的情况下关闭了推理功能。“Default”意味着模型以提供商默认提供的推理行为运行。我未调整 Temperature(温度)参数,也未探究不同模型所使用的默认设置。