思维是智能吗

作者将中考复习比作AI微调,认为机械刷题消耗了学生对知识的好奇心。他反思,在AI能解答标准问题的时代,真正值得培养的是质疑与追问的能力,而非仅追求分数。中考的意义不应被全盘否定,但需避免沦为应试的“语言模型”。

关于中考复习,几个月前写了这段话,但是由于遗忘未予以发表,在此 水一篇博客 予以发表。

不识庐山真面目,只缘身在此山中。
——苏轼《题西林壁》

久居尘世,却忘记何以为人

课内复习是无聊的,一轮复习中,文科讲的是一堆你一定想不到的答题点,而理科则是将这三年学习过的知识再过一遍,而二轮复习改为找来本市其他区的模拟题考,考完再讲解。不到一个月的时间决定了复习会极为仓促,每个知识点就像是走马观花一样,课后练习也是中档题偏多,给人的感觉是自己被当成了正在训练的 LLM,在第一阶段训练完成后还要接受 RLHF 微调,即先学知识再调行为,只是为了「提高在部分场景下的准确率」。

这种被「微调」的感觉,让我想起最近读到的一段关于AI训练的评论:

GPT 5 开始出现的大量谄媚表述、滥用单字汉字词、令人烦躁的口癖,Grok 不长脑子的自来熟、DeepSeek 的致死量形容词名词叠叠乐,还有 Claude 的「是诚实的」「我必须诚实」一看就是后训练的时候把「Honest,会就说会不会就说不会」当成标准,导致此表达开始爆炸般地变多。这类微调在最近一两年的模型当中被做得越来越多,下手越来越狠,口味越来越重。在我看来这是必然的事情,因为人们对大语言模型的期待和想象只会变得越发细致和具体,而这每一条期待都是束缚大语言模型表达的枷锁。
From https://sspai.com/post/110102

感觉是被当成了 LLM,每次考试都像是测试不同能力的 benchmark,要为下一阶段的微调提供方向。而我们则变成了在 benchmark 中取得高分,却在与他人真正交流时被冠以「人机」之名的人。

哦对了,我们删除了除体育之外的其他副科,并以主课代之。

原本来学校是为了学习新知识,即使是复习也应该是「温故而知新」,在复习旧知识的同时有新的感悟,但这样略显机械的刷题让我们感觉身心俱疲,同学们时常出现心不在焉的现象。

  • 像我一样已经签约上特长生的同学因为中考压力不大,所以上课不怎么认真听讲,可能是发呆后忽然被老师点起来,也可能是上课写家庭作业被制裁、和老师顶嘴被说成「破坏班级学习氛围」,更有甚者直接请假不来了
  • 中等生也较为疲倦,下课打掼蛋/uno牌
  • 学习欠佳的同学也在忙碌的课表中耗尽精力,得找个地方释放,于是就有了将整个厕所的隔间及门拆除/每个课间十分钟从五楼到一楼打羽毛球的「壮举」

我知道,学校和老师确实在有限时间内拼尽全力——把副科换成主课、刷模拟题并进行针对性训练,目标很明确:提分。但是当复习变成了走过场,温故而知新被刷题取代,我就是在为考试而学习,而非为知识本身。曾问过一位学习拔尖的同学为何来学校复习,此人答曰,因为在家更无聊,在学校还能打牌。

若学校的吸引力止步于社交,而在学习方面以消耗学生的活力、对知识的好奇心为代价,换取微薄的成绩提升,我不禁反思:中考,难道是一锤子买卖,将这段时间赌进去就能承诺完美的未来吗?如果不是,为什么要这样做?

就连中考指定的《时事》杂志上也有这样的新闻:(原文如此)由美国公司「深层思维」研发的、搭载深度思考能力的「双子座」人工智能模型达国际数学奥林匹克金牌水平,获官方认证。就连数学竞赛题这种「人类思维的自留地」都已被AI攻下,说明我们引以为傲的思维也能够被轻松替代。

我们应当清晰地定义在这个上下文中的思维,它应该指解决问题,特别是边界清晰、逻辑封闭、存在明确正误的问题的能力,也就是我们在学校常练习的这种题。或许你花费一下午苦思冥想的巧妙解题思路令你引以为傲,可是同样的答案只要几块钱的 token 花费就能够买到,那么我们依靠中考前一轮一轮复习获得的微薄的成绩提升,真的有意义吗?

如果抛开AI不谈,仅就复习本身而言,加缪会说:没错这确实没有意义,但是这一复习过程构成了一种独特的生命体验。但显然我没有像西西弗一样超脱的思想,没法置一地鸡毛的结果于不顾,所以我得另寻解释。

或许有人会说(当然老师也这么说),中考是一种评价,作为被评价的人,你没有资格评判评价标准是否有意义,相反,你应当尽可能地提高分数,上更好的高中,以自己的努力获得更好的资源。这种评价是有道理的,但是上了好高中,然后呢?当我们进入社会,面对的竞争者不仅是彼此,还有 AI。与其乐观地相信「船到桥头自然直」,我们不如想一想,凭什么说服公司使用成本更低、能快速完成数学题的 LLM?我们活成了一台披着人类外壳的 LLM,看到一个题目后调动可能的知识,将它们拼起来形成一份答案,然后前进到下一题。一切都是因为「我被教导该这么做」,而没有想过「这么做的意义是什么」。当AI可以替我们解答所有「有标准答案」的问题时,真正的智能就不再表现为给出正确的答案,而是提出那些没有现成答案、却值得用一生去追问的问题。

在乔治·奥威尔的《1984》中,人们从多个方面被剥夺了思考的权利:无处不在的电幕消解了人的私人空间,则独立思维也无从谈起;而屏幕中出现敌人果尔施坦因的脸时,所有人必须立刻进入狂暴的仇恨状态,当人民刚刚可能产生一丝「为什么他是敌人」的疑问时,集体的怒吼就会立即淹没那个念头,把潜在的理性思考转化为无需动脑的动物性反应。所谓的「双重思维」,要求你同时接受两个互相矛盾的观点并不予思考,「知道又不知道;同时支持两种相抵的意见,明明知道两者互为矛盾,却两者都相信;用逻辑对抗逻辑;声称自己崇尚道德,却又做出违反道德的事」,本质上是对独立思考能力的阉割。

1984中的人们被剥夺了智能的能力,而 LLM 生来就只有思维而没有智能,其中后者是指不仅能完成任务,还能理性考虑「为什么要完成任务」的自我反思能力。

另外智能还有一个体现。或许有读者看到过早期 Claude 模型面对海量训练材料质疑「这可能是在测试我的能力」,或是曾惊叹于 DeepSeek 开了深度思考后极为拟人的“心理”活动,认为这就是智能

但是必须指出的是,人类太习惯用文字表达思想,以至于误以为能生成意识载体的系统,就拥有意识本身。正如这个视频指出的,你看到 LLM 输出「我很悲伤」,或者更进一步地,若你使用的是 ChatGPT 的 Advanced Voice Mode(应该是这个名字),你还能听到合成的声音稍微停顿了一下,甚至还夹杂着抽噎的声音,但你仍会意识到,这和你与一位熟悉的朋友交流时聊到悲伤的话题时产生的感受是不同的,你会意识到,与你共情的是人而不是 LLM。

另外讲一件真实的例子:老师在语文课上发了一份带有「一句话总结」「温柔地接住」等常见 LLM 用语的教案,让同学们不愿意看。即使这份教案确实承载了有意义的知识,但我们依旧会因为「不是老师本人写的,没有诚意」为由不由自主地感到抗拒。这说明结果的等价,永远无法抹杀过程的本质(没错斜体部分是 Deepseek 写的),情绪等人文价值也是可贵的。

柏拉图有一个著名的「山洞寓言」,大致内容是在山洞中,一群被锁住的囚徒只被允许看向洞内,而太阳光由洞外射入,被洞外的人们操纵的木偶遮挡后在洞穴的墙壁上形成多样的影子,引得囚徒们浮想联翩,却没有囚徒尝试逃离,看看阳光下真实的世界究竟是什么样的。

这个寓言在本文的语境下也可有另一种解读:真实世界的知识(即太阳)被提取成文字,给 LLM 训练,但 LLM 「看」着海量的文字,并不能理解文字背后的物理关系或是人类情感,它只是看着洞穴壁上的影子(即训练数据),预测「下一个影子根据历史规律应该是这样」,可它却没有想过、也无法看看产生影子的太阳是什么样的。

它不能带你走出洞穴(因为它没有见过阳光),但它能把你前辈们几千年来所有试图走出洞穴的路线图、试错记录和争论焦点,呈现在你面前。真正带你走出洞穴的,始终是你自己的好奇和质疑的灯。

若言琴上有琴声,放在匣中何不鸣?
——苏轼《琴诗》

AI的“思维”究竟藏在算法的参数里,还是源于人类叩问与赋予意义的瞬间?

综上,中考的意义不应被全盘否定,但若将其视为唯一目的,我们便可能在不自知中沦为应试的「语言模型」。在AI能解答一切标准问题的时代,真正值得培养的,恰恰是那些无法被token化的能力——好奇、质疑与追问。(没错这一段又是Deepseek写的)

我让 Deepseek 阅读了这段内容并予以评价,如果你好奇,可以点击这个链接查看

仅有 1 条评论
  1. test

添加新评论