跳转至

03 模型预测

本章主线 · AI导读

作者以已见与未见区分记忆和学习,以压缩与泛化区分模型能力,并用“渐构”强调模型要在失败反馈中持续修订。

4 处重点与评注全书精读导览

拾取决策

梳理完各个环节和组件后,我们再回到拾果子问题:该不该拾取图2-2中的未见果子?

由于该果子并不满足 “有若干圆圈图案的果子” 这个属性,你利用判别模型将其判别到了非加分果的概念,于是采用不拾取这一应对方式。

模型预测

可以看出,运用类化应对的关键是模型。我们把这种利用模型来预测的方式称为“模型预测”。模型预测是预测能力的第二处来源。

模型

之所以用“模型”这个名称,是因为我们并没有直接在现象层面去逐一应对,而是在脑中构造了一种思维单元(也就是概念),作为一群现象的代表,间接地进行推演和模拟。这就像建造一个手工模型代表真实的建筑、车辆等事物,来做推演和模拟一样。“模型”一词则刚好体现了这种现实替身的特性。

当然,由于这是一种思维中的模型,也可以被称为“心理模型”或“思维模型”。

两种预测

现在我们知道了预测能力的两处来源——经验预测和模型预测。

◎ 经验预测可以赋予我们对已见情况的预测能力。

◎ 模型预测有机会赋予我们对未见情况的预测能力。

实际加分

为什么说“有机会赋予”呢?因为我们所建构的模型,未必就能对未见情况进

行成功预测。

例如,你预测拾取那个果子会减分,但实际上拾取那个果子会 +3 分,如图 3-1 所示。

03 模型预测 · 原书插图 file13.jpg

03 模型预测 · 原书插图 file14.jpg

03 模型预测 · 原书插图 file15.jpg

03 模型预测 · 原书插图 file16.jpg

03 模型预测 · 原书插图 file17.jpg

图 3-1

这时你会意识到,其实还有一种抽象方式,也能满足所有已见情况——忽略图案是圆圈还是浪条的差异属性,仅保留具有奇数个封闭图案的属性。

即使你换了这种抽象方式,再来一个未见果子时,依然可能预测失败。注因为抽象方式是无限的,我们只能 \(100 \%\) 保证所建构模型符合搜集到的所有经验,不能 \(100 \%\) 保证所有未见情况都符合这个模型。

模型验证

因此,建构模型来预测未见情况时,需要经过验证。如果预测失败了,我们就将失败的情况也纳入已见,更新所建构模型。

拾新果子

例如,你先运用所建构模型,得到一个“拾取后果”的预测,在将它与实际的“拾取后果”进行比对,看看二者是否相同。这就是一次模型验证。

压缩能力

由此你会发现,并非所有模型都能预测未见情况。如果我们所建构的模型仅适用于已见,不适用于未见,那该模型就仅具备记忆已见情况的能力。这其实是模型的能力之一,叫作“模型对经验的压缩能力”,简称“压缩能力”。

之所以称其为 “压缩”,是因为不论有多少经验,只要满足同一个共性,就可以被一个模型所概括,进而减少占用的存储空间。

压缩拾果

例如,你所建构的第一个模型,虽然不能预测未见果子,但可以将拾取3个果子的经验都压缩在一个模型中。

假如你搜集了拾取 100 个果子的经验,只要找到了它们的共性,同样可以将它们压缩到一个模型中,也就不必挨个回忆这 100 个果子到底是会加分还是会减分。

泛化能力

不过,我们更为感兴趣的是模型预测未见情况的能力,我们将这种能力称为“泛化能力”。

如果所建构模型的泛化能力不够强,没达到我们的要求注,就称“模型的泛化(能力)不足”。

知识

如果我们所建构模型的泛化能力足够强(从未泛化失败过,或是成功率高到我们可以接受的程度),我们就把这个模型称为“知识”。

可见, 知识必须具备可泛化性(普遍性), 能够超越经验, 适用于广泛的未见情况。

人非永生

例如,“人非永生”所表达的就是一个知识。它不仅适用于孔子、嬴政等我们已知的过世之人,也适用于笔者本人以及每一位读者,具有超越经验的普遍性。

信息

与知识相对的是信息。信息是本身不具备普遍性的单一情况或现象。

孔子死了

例如,“孔子死了”所表达的就是信息。它仅适用于孔子一人,属于单个情况,不具有普遍性,本身不能用于推测未见情况。

记忆

将已见情况原封不动保存在大脑中的行为,被称为“记忆”。

判别一个行为是否属于记忆,关键在于行为目的:只要其目的是为了保存信息,即使最终没有成功,也被归为记忆。

记国庆

例如,某小学生的行为目的是将“中国的国庆节是10月1日”原封不动地保存到脑中,结果失败了。该小学生的行为仍被称为记忆。

学习

与记忆相对的是学习。学习是指建构具有泛化能力的模型的行为,也就是塑造预测未见情况的能力的行为。

记忆无须举一反三,但学习必须举一反三,或者说,只有能举一反三的行为才被称为学习。

记忆与学习所针对的对象也不相同:记忆的对象是信息,学习的对象则是知识。

记身份证

例如,你把自己的身份证号码保存到脑中,不是学习,是记忆。但如果你在建构一个根据号码来推测未知个体性别的模型,则是学习。

历史

又如,你将“秦始皇死于公元前210年”和“苏格拉底死于公元前399年”保存在脑中的行为,不是学习,是记忆。但若你用它们作为经验,来建构人非永生这个可泛化模型,则是学习。

仅压缩

如果你的行为目标是压缩拾取果实的那三个经验,而非预测未见情况,那么即使你在建构模型,也不是学习,而是记忆。

定义不同

注意,本书对“知识”“信息”“学习”“记忆”这四个词采用的都是专业定义注,

而非日常用法。就像“功”在物理学中的含义不同于日常用法一样。

之所以这样,是因为本书并非单纯提供一些启发性的内容,而是要为读者建构一套能够精准描述学习现象的理论体系。这要求本书必须像物理学书籍一样,为每一个术语提供明确的定义,使理论的使用者能够清楚每个名词指代哪些现象。在日常用法中,这些词往往内涵模糊、边界不清,一个现象是否属于学习的判断并不统一。这在需要精准描述现象的理论中,是绝对不允许的。

拿 “学习” 一词来说, 本书中采用的是认知视角下的定义。而在日常用法中, “学习” 一词通常指社会互动层面上的 “向他人获取有价值内容的行为”, 不能准确描述个体内部的认知过程。

例如,按照日常用法,记忆自己的身份证号码不被视为“学习”,而记忆一位名人的名字却被视为“学习”。从认知过程来看,这两种行为本质上并无区别,差别仅在于所记忆内容的社会重要性不同。在本书的定义中,这两种行为都不属于学习,而属于记忆。

又如,有的家长常会说:“别玩了,快去学习。”在日常语境中,“玩”和“学”常被视为对立概念。然而,如果某款游戏被纳入高考科目,那么玩这款游戏又会被家长称为“学习”。从认知过程来看,这两种行为也无本质区别。按照本书的定义,只要一个人在建构可泛化的模型、塑造预测未见情况的能力,就属于学习——无论要预测的情况是来自物理世界,还是游戏世界。

渐构

考虑到人们已经习惯了“学习”一词的日常用法,本书为该行为提供了一个别名——渐构。

之所以使用“渐构”这个词,是因为记忆可以保证 \(100\%\) 成功,但学习却不一定,哪怕学生已经 \(100\%\) 理解了书本或课堂内容。这并不意味着学生做错了什么,而是学习本身就是要超越已见,超越书本和课堂,可没人能确保基于已见情况所建构的模型能 \(100\%\) 适用于未见情况。因此,学习必然需要不断在泛化失败中持续迭代和更新脑中的模型。注

为了更准确地从名称上体现该行为的本质, 本书将 “建构” 中的 “建” 改为 “渐”,

意为“逐步迭代地建构”。

本书后续出现的“学习”和“渐构”,都指代迭代建构可泛化模型这一含义。

词义

凡是本书中专门定义过的词汇,例如“现象”“物质世界”“判别模型”“类化”“抽象”,都要严格按照书中提供的定义来理解和使用,切不可随意从其他资料中照搬(例如,去百度查“类化”的含义,把心理学的含义搬到本书中来用),也不能按照日常用法去理解(例如,在网络用语中,“抽象”有怪诞、令人摸不着头脑之意)。即便这些词在外部语境中有相同或相似的名称,它们在本书中所指的含义也可能完全不同。若不加区分,极易产生误读,导致对整个体系的理解出现偏差。

经验何用

至此,我们明确了模型预测中各个名词的含义,为后续的阅读做好了铺垫。

不少读者可能已经产生了疑问:第 01 章明确指出,在物质世界中,经验预测失去了作用。那么,为什么本章还说经验预测是预测能力的一处来源呢?

主干提要

  1. 预测能力的两处来源——经验预测和模型预测。
  2. 模型的压缩能力可实现记忆。
  3. 模型的泛化能力可实现学习。
  4. 普适性强的模型会被固化为知识。
  5. 根据塑造的能力所针对的是已见还是未见,可划分出记忆和学习(渐构)。

概念提要

◎ 模型预测:利用模型的泛化能力实现的预测。

◎ 模型:以虚构类别(概念)代替和模拟实际现象的结构。

◎ 模型的压缩能力:模型适用于已见情况的能力。

◎ 模型的泛化能力:模型适用于未见情况的能力。

◎ 知识:普适性足够强的模型。

信息:不表达普遍性的单一情况或现象。

◎ 记忆:塑造重现已见情况的能力的行为。

◎ 学习:塑造泛化未见情况的能力的行为。

◎ 渐构:学习的别名——迭代建构可泛化模型的行为。