最近刷知乎,看到一个挺有意思的问题:说话也有恐怖谷效应吗? 这个提问在站内拿下了114万热度,链接我放这儿:https://www.zhihu.com/question/449596775。底下回答五花八门,有人讲AI客服,有人讲配音演员,还有人聊起了自己遇到过的“语调怪人”。今天咱们就顺着这个话题,把“恐怖谷”从视觉领域拽到听觉领域,好好掰扯掰扯。
先简单回顾:什么是恐怖谷效应
恐怖谷理论最早是森政弘提的,说的是当非人物体(比如机器人、人偶)在外形上越来越像人,但还没完全像人的时候,人类会对它产生强烈的反感、恐惧甚至恶心。可一旦它跨过那个“几乎完全像人”的临界点,好感度又会回升。
关键点在于:“像”和“是”之间那条缝隙,才是最瘆人的地方。
那问题来了——视觉有恐怖谷,听觉有没有?
说话这件事,确实存在“恐怖谷”
我的观点很明确:有,而且比视觉恐怖谷更隐蔽、更日常。
你想想,我们判断一个人说话“怪不怪”,其实不光是听内容,还在听语调、节奏、呼吸、停顿、情绪颗粒度。当这些元素组合起来“像人,但又不完全像人”的时候,大脑就会拉响警报。
举几个你大概率遇到过的场景:
- AI客服的“热情”:语气上扬、停顿精准、每个字都清晰得过分。你明明知道对面不是人,但它又努力模仿人的亲切感,结果就是浑身不自在。
- 配音演员的“译制片腔”:不是配得不好,而是那种过度字正腔圆、情绪饱满到失真的说话方式,让人感觉“这不像活人在聊天”。
- 某些短视频里的AI合成音:断句诡异、重音乱放,偶尔还来个不合时宜的升调。你听三秒就想划走,不是因为难听,是因为瘆得慌。
这些例子的共同点就是:它们都踩在了“像人”和“不是人”的中间地带。
为什么说话也会触发恐怖谷?
我查了一些认知科学和语音感知的资料,大概能归纳出三个原因:
第一,语音是带有生物信号的。 真人说话时,呼吸、心跳、肌肉微颤都会混进声音里。AI或者过度处理过的语音,把这些“生物噪音”抹掉了,听起来就“太干净了”,干净到不像活物。
第二,韵律期待被打破。 人类对话有来有回,有抢话、有沉默、有“嗯”“啊”这种填充词。当一段语音的韵律完美到没有一丝犹豫,大脑就会觉得不对劲——太流畅反而假。
第三,情绪和语义的错位。 比如用欢快的语调说“您的账户已被冻结”,或者用平静的语气说“我好难过”。这种错位在真人身上很少见,但在合成语音里很常见,听多了就会产生类似恐怖谷的不适感。
一个容易被忽略的增量信息
很多人以为恐怖谷只跟“像不像人”有关,但其实说话恐怖谷还跟“意图感知”挂钩。
简单说:当你听到一个声音,大脑会下意识判断“它想对我做什么”。如果这个声音听起来像人,但又让你觉得“它没有真实意图”,你就会产生警惕。这跟看一个仿真机器人时的感觉是一样的——你知道它没有灵魂,但它又装得有灵魂。
所以,AI语音越进化,这个问题反而越突出。因为早期的机械音你一听就知道是机器,反而不恐怖。现在的一些大模型语音,已经能模仿叹气、笑声、甚至哽咽,但偶尔又会冒出一点“非人感”,那个瞬间才是最让人后背发凉的。
怎么应对这种“说话恐怖谷”?
说实话,完全避免很难,但可以留意几点:
- 对AI语音保持“功能化”期待:把它当工具,别当人。它热情也好、冷淡也好,都是参数。
- 真人内容里,允许“不完美”:停顿、口误、呼吸声,反而是真实感的来源。
- 做内容创作的朋友:如果你用AI配音,适当加点环境音、呼吸声,或者手动调整断句,能大幅降低恐怖谷效应。
最后说两句
说话也有恐怖谷效应吗? 我的答案是:有,而且它正在从科幻概念变成日常体验。114万人关注这个问题,说明大家已经隐约感觉到了那种“像人又不是人”的语音不适感。
下次你再听到一段让你莫名不舒服的语音,别急着怪自己挑剔——可能是你的大脑,正在帮你识别那个“恐怖谷”。
微信扫码查看