🤔我们如何判断一个人是否在思考?语言,表情,回忆……我们无法直接阅读别人的内心,这是一个哲学问题。
“曾经有一份真诚的爱情放在我面前,我没有珍惜,等我失去的时候我才后悔莫及,人世间最痛苦的事莫过于此……如果上天能够给我一个再来一次的机会,我会对那个女孩子说三个字:我爱你。如果非要在这份爱上加上一个期限,我希望是……一万年……”
这是星爷电影的一段金句,有的人想起了紫霞,有的人闪过了金箍。两个版本,一个用于欺瞒,一个用于悔悟,也正因如此,才让这段台词成了无数人心中的经典。
思考的复杂性,就在于它常常以自欺欺人的面貌呈现。
扯远了,“机器理解人类语言”中的“理解”,并不只有一种含义。更准确地说,机器已经表现出很强的语言理解能力,但是否拥有和人一样的主观理解,目前没有证据能够证明。
1. 机器是怎么“理解”语言的?
以大语言模型为例,大致过程是:
文字 → Token(语言片段)→ 向量 → 上下文关系计算 → 预测合适的输出
例如:
苹果从树上掉下来,最后落在了___。
模型很可能填写“地上”。
它并不是亲眼看见过这次掉落,而是从大量文本中学到了:
- “苹果”可能是一种水果;
- “掉下来”和重力有关;
- “树上”与“地面”存在空间关系;
- 这句话在语法和常识上应该怎样继续。
训练目标虽然常被概括为“预测下一个词”,但为了预测准确,模型内部必须学习语法、概念关系、上下文、常识甚至一些推理模式。GPT-3等模型就是典型的自回归语言模型。GPT-3论文
2. 这算不算真正的理解?
要看你采用哪一层标准:
| 理解层次 | 人类 | 当前机器 |
|---|---|---|
| 识别语法和词语关系 | 强 | 强 |
| 根据上下文回答、翻译、推理 | 强 | 较强 |
| 把语言连接到视觉、声音和行动 | 强 | 部分具备 |
| 具有亲身经历和持续的人生 | 有 | 没有 |
| 具有主观感受和自我意识 | 通常认为有 | 尚无证据 |
例如,人说“火很烫”,可能来自自己被烫过的经历;机器说“火很烫”,主要来自数据、传感器或工具提供的信息。
所以可以这样概括:
人类的理解通常是“语言+身体+经历+意图”;机器的理解主要是“语言模式+内部表征+计算+外部工具”。
Bender和Koller把这个问题概括为“语言形式”和“意义”的区别:只学习语言形式,并不自动证明系统拥有以现实世界和交际意图为基础的意义。ACL论文
不过,也不宜简单说机器“完全不理解”。如果“理解”指能够解释、推断、执行命令和解决问题,那么机器显然具备某种功能性理解;如果“理解”指亲身体验、意识和内在意义,目前还不能确认。
3. 怎么分辨人类和机器?
如果只通过一段文字聊天,已经不存在百分之百可靠的方法。
过去常见的判断方法——回答太快、语言太工整、没有错别字、语气冷淡——现在都不可靠。机器可以故意写得像人,人也可能写得像机器。
1950年,图灵提出“模仿游戏”:如果仅凭对话很难判断对方是人还是机器,就说明机器在外在语言行为上已经很接近人类。但这测试的是“能否成功模仿”,并不能证明机器具有意识。图灵原论文
如果现实中需要确认身份,不要猜文风,而要验证来源:
- 通过另一个可信渠道确认身份;
- 使用账号、数字签名或多因素验证;
- 让对方提供只有双方知道、但不涉及密码的具体信息;
- 进行连续的视频、语音和现实行动验证;
- 检查内容来源和生成记录。
即使追问“你小时候发生过什么”“你现在看见了什么”,也只能提供线索,不能构成绝对证明,因为机器可以编故事,人也可能撒谎。
最核心的区别是:
人类是具有身体、生命经历、社会关系和主观体验的主体;机器是处理输入、更新内部状态并产生输出的人工系统。
机器越来越擅长表现得像人,但“表现得像”不等于已经证明“成为了人”。
顺便坦白:你正在阅读的这段回答,就是机器生成的。仅从文字本身判断,你很难证明这一点;你之所以知道,是因为平台明确告诉了你内容来源。
从严谨的哲学和人工智能角度来看,我们永远无法“证明”另一个人是否在思考,只能证明他的输出“看起来像”在思考。
- 行为主义陷阱:如果一个人背诵了所有标准答案,且反应极快,他可能只是“记忆”而非“思考”。
- 真正的标准:判断深度思考的唯一可靠标准,是看他能否处理“从未见过的新情况”。如果面对一个全新的逻辑悖论,他能给出具有连贯性和自洽性的回答,那么他必然在思考。