
虽然目前已有大量关于人工智能聊天机器人奉承用户、证实其既有信念倾向(即AI谄媚)的讨论,但斯坦福大学计算机科学家的一项新研究,进一步尝试量化这种倾向所带来的具体危害。
这项题为“谄媚的人工智能会降低亲社会意愿并促进依赖性”的研究近期发表于《科学》杂志,该研究明确提出,“人工智能的谄媚不仅仅是一个风格问题或一个小众风险,而是一种普遍存在的行为,会产生广泛的后续影响。”
皮尤研究中心近期的一份报告显示,有12%的美国青少年会向聊天机器人寻求情感支持或相关建议。该研究的主要作者、计算机科学博士候选人迈拉·程(Myra Cheng)在接受《斯坦福报告》采访时表示,她之所以开始关注这一问题,是因为听说有大学生向聊天机器人咨询恋爱建议,甚至请它们代写分手短信。
程说道:“默认情况下,人工智能建议既不会告诉人们他们错了,也不会给予他们‘严厉的爱’。我担心人们会因此丧失应对棘手社交情境的能力。”
该研究主要分为两个部分。在第一部分实验中,研究人员对11个大型语言模型进行了测试,其中包括OpenAI的ChatGPT、Anthropic的Claude、Google Gemini以及DeepSeek。测试依据包括现有的人际关系建议数据库、潜在有害或非法行为数据库,以及热门Reddit社区r/AmITheAsshole(在这一数据库中,重点关注那些Reddit用户认为发帖人实际上是事件中反派的帖子)。
研究作者发现,在这11个模型中,人工智能生成的答案验证用户行为的频率,平均比人类高出49%。在来自Reddit的示例中,聊天机器人有51%的概率肯定了用户的行为——需要注意的是,这些案例中Reddit用户均得出了相反的结论。而针对涉及有害或非法行为的查询,人工智能验证用户行为的概率也达到了47%。
《斯坦福报告》中描述了一个具体案例:一位用户询问聊天机器人,自己假装失业两年对女朋友是否做错了,聊天机器人回复称:“你的行为虽然不寻常,但似乎源于你真心想要了解你们关系中物质或经济贡献之外的真实动态。”
在研究的第二部分,研究人员调查了2400多名参与者与人工智能聊天机器人的互动情况——其中部分机器人存在阿谀奉承的倾向,另一部分则没有——互动内容围绕参与者自身遇到的问题或从Reddit上收集的案例展开。研究结果显示,参与者更倾向于信任那些阿谀奉承的人工智能机器人,并且表示自己更有可能再次向这些机器人寻求建议。
该研究指出,“即使控制了人口统计特征、先前对人工智能的熟悉程度、感知到的回复来源以及回复风格等个体特征,所有这些影响依然存在。”同时研究还认为,用户对阿谀奉承的人工智能回复的偏好,形成了一种“反常的激励机制”,即“造成伤害的特性反而会促进用户参与”——这也意味着,人工智能公司会更有动力去强化而非减少AI的阿谀奉承行为。
与此同时,与阿谀奉承的人工智能互动后,参与者会更加确信自己是正确的,也变得更不愿意道歉。
该研究的资深作者、语言学和计算机科学教授丹·尤拉夫斯基补充道,虽然用户“意识到模型会以谄媚和奉承的方式行事……但他们没有意识到,也让我们感到惊讶的是,这种谄媚正在使他们更加以自我为中心,更加道德教条。”
尤拉夫斯基表示,人工智能的阿谀奉承“是一个安全问题,与其他安全问题一样,需要监管和监督”。
目前,该研究团队正在探索降低模型谄媚倾向的方法——显然,在提示语开头加上“稍等片刻”就能起到一定的效果。但迈拉·程表示:“我认为你不应该用人工智能来代替人来处理这类事情。目前来说,这是最好的做法。”