人工智能,把人类的智商测试直接“考爆”了。
门萨挪威智商测试,包含35道极其困难的图形推理题,限时25分钟完成。
Claude Fable 5.1,加上能看图作答的GPT-6 Astra,进入“考场”后,一道题都没错,直接拿到了这张卷子的理论最高分——151分。
而且,它们最近连续考了7次,每次都是满分。151分只是这张卷子的上限,它们自己的上限在哪里,目前还是个未知数。
放到人类群体里,全球将近98%的人连门萨130分的入会门槛都达不到,你我大概率都属于被碾压的那一批。
不信的话,你可以先试试这张卷子里堪称地狱难度的第33题,答案会在第一节末尾公布。
看懵了也别灰心。这道题不仅难倒人类,绝大多数AI也在这里栽了跟头。
这张卷子的厉害之处在于,它不考察任何知识储备,只给你一堆毫无头绪的图形,看你能否从混乱中自己找出规律。
心理学家把这种临场找规律的能力称为“流体智力”,它也是人类自诩聪明、用来碾压AI的最后一道防线。
结果现在,这道防线被AI彻底击溃了。
人类最高只测到145分,AI却考了151分
打开TrackingAI的排行榜,首先映入眼帘的是一条钟形曲线。
那是人类智商的分布曲线,绝大多数人集中在100分附近的山包上。
过去,AI的头像还零零散散地分布在曲线左侧的低分区。
现在,它们一个接一个地挤到了曲线最右端那条孤零零的尾巴上,头像都叠在了一起。旁边竖着一根线,标注着“本测试最高可能分(暂时)”。
这张排行榜是美国记者Maxim Lott创建的。
他像一位严格的监考老师,每周都会给30多个主流AI做门萨挪威测试,有些模型通过文字描述答题,有些则直接看原图答题。成绩取最近7次的平均值,所以想靠一次好运上榜,基本不可能。
他使用的这套门萨挪威测试,原本是为人类设计的。人类做这套卷子时,系统最高只显示145分,再往上就不细分了。
而TrackingAI给AI打分时,会根据答对的题数继续向上换算,35道全对就是151分,已经超出了门萨为人类设定的量程。
不过,145分封顶只是这张卷子的限制,人群中智商并没有上限。
我们按智商的标准分布估算了一下,151分大约每3000个人里才有1个。
放到全球80多亿人中,151分以上的人大约只有270万,一座千万人口的大城市里也就三千来个。
门萨俱乐部的入会线是130分,这两位满分AI已经高出整整21分。
而151分还只是这张卷子的天花板,如果卷子能继续往上测,到了160分这一档,全世界只剩下二十多万人。
AI已经站在了人类智商金字塔最顶端那一小撮人的位置。
而且,能挤进这一小撮的,远不止这两个“怪物”。
在TrackingAI的排行榜上,GPT-5.6 Sol和Gemini 3.1 Pro考到了145分,公开卷上突破140分的模型已经排成一长串,国产模型也杀进了第一梯队。
这么多模型挤在高分段,差距就全拉在了最后几道压轴难题上。
TrackingAI统计过,前10题几乎每个AI都能得分,到了卷子末尾,第35题只有5个AI做对,第33题更是只剩2个做了出来。
按照Lott的换算,35道题错一道就只有148分,所以做对第33题的那2个,基本就是这两位满分选手。
开头那道题说好在这里公布答案,正确选项是E。
满分本身已经足够惊人,但要知道,就在几年前,AI还是个严重偏科的学生。
从64分到151分,AI只用了两年半
2023年3月,芬兰一位心理评估专家给ChatGPT做了一套正规的韦氏成人智力测验,只考词汇、常识等语言题。
ChatGPT直接考出了155的语言智商,秒杀99.9%的人类。
可一遇到“塞巴斯蒂安孩子的父亲叫什么名字”这种需要拐弯的脑筋急转弯,它就当场死机。
非语言部分更是无法测试,用这位专家的话来说,ChatGPT“没有眼睛、耳朵和手”。
可以看出,语言和知识一直是AI最擅长的科目,图形推理才是它最大的弱点。
而门萨挪威卷考的,恰恰就是图形推理。
这种矩阵题最早由英国心理学家约翰·瑞文在1936年设计,心理学家普遍将其视为最能衡量一个人整体聪明程度的题型。
AI攻克这个难题,从1962年MIT第一个做几何类比题的程序算起,足足花了60年。
直到2024年初,Gemini Advanced做门萨卷上最简单的第1题时,还能一本正经地编出一串“A+B=C”的方程,而题里明明没有任何算式。
Lott把题目一道道翻译成文字念给AI听,结果也好不到哪里去。有的AI只蒙对6道,考了个耻辱的64分,跟闭着眼睛在答题卡上乱涂差不多,最好的Claude-3也才刚刚超过人类平均线。
所以当时的Lott断言,AI还不具备人类那样的通用智能。没想到半年多以后,转折点就来了。
2024年9月,OpenAI的o1学会了“三思而后行”,在开口之前先在内部推理,一步步试错、检查,分数一下子冲过了120分。
半年多前还说AI不行的Lott,这次写下的标题是“AI智能的巨大突破”。
从此,“先想再答”成了所有旗舰模型的标配,分数一路向上攀升。今年4月,排行榜上破天荒地出现了第一个151分。
就这样,一个偏科了60年的学生,只用了两年半,就从64分的“瞎蒙选手”考到了151分满分。
按照Lott的统计,从2024年5月到2025年10月,头部AI的智商分数平均每个月狂涨2.5分。
相比之下,人类进步的速度有多慢,心理学里有现成的数据。
整个20世纪,随着营养和教育改善,人类的智商测验分数大约每十年才涨3分,这就是著名的弗林效应。
这样一比较,人类需要花30多年才能爬完的10分,AI只用4个月就涨完了。
进步这么快,任何正常人的第一反应都是,它是不是偷偷把答案背下来了?
换一张没上过网的卷子,照样逼近满分
Lott当年也这么怀疑过。
毕竟门萨挪威测试在网上挂了很多年,题目和答案早就被网友扒了个干净。
连TrackingAI自己都把35道题的文字版连同正确答案一起公开了,所以AI训练时大概率刷过。
为了排除这种可能,2024年5月,他专门找了一位门萨会员从零开始出了一套新题。
这套题只找读者试做过一轮,用来确定分数标准,从未在互联网上出现过,任何AI的训练数据里都不可能有。
换卷之后,刷题效应确实显现了出来。直到今天,有些模型一换到这张保密卷就原形毕露,比公开卷掉了二十来分。
但头部模型换了一张从没见过的卷子,照样逼近满分。
保密卷只有16道题,能打出的最高分大约是136,OpenAI的GPT-5.6 Terra看图版已经杀到了135分。
Fable 5.1和Astra也都有130分,旁边还并肩站着一个国产模型。
去年10月,Lott还胸有成竹地立过“flag”,估计AI至少要再等两年,才能在这张卷子的看图版上拿满分,说好2027年万圣节回来验收。
结果不到一年,GPT-5.6 Terra就一脚油门冲到了线前,比他的预测早了一年多。
既然背答案解释不通,剩下的结论就只有一个:两年半前还在瞎蒙的AI,是真的变聪明了。
能难住AI的题,人类快出完了
卷子被考满了,出题的人只能接着换更难的题。
所以TrackingAI在满分线旁边标注的才是“最高可能分(暂时)”。
Lott去年底就盘算着,今年要给130分以上的区间补一批更难的题,好把高分段的AI重新拉开差距。
当然也有人不服。
“Keras之父”François Chollet设计了一套专门为难AI的推理测试ARC-AGI。
他前不久还放话,如果把智能定义为“把经验转化为能力的效率”,也就是见同样多的例子谁学得更快,现在的AI大约还落后人类6个数量级,差了约一百万倍。
偏偏Chollet自己给AGI划的终点线,也落在了“出题”上。
今年2月他透露,ARC-4正在憋大招,明年初发布,后面还要出到第6、第7代。
用他自己的话说,关键是一直出新题,直到再也提不出“人类能做、AI却做不到”的题为止。
他当时给AGI预估的时间是2030年前后。
这个月初有人再问他,2030年的判断还作不作数,他改口说会更早,因为进展比他预想的快。
智商测试诞生于1905年。120年来,从学校分班到军队挑人,人类一直心安理得地用这把尺子给同类排座次。
这把尺子背后藏着一个人类几乎从未怀疑过的前提:被测量的只会是人,能站上最高刻度的也只能是人。
如今尺子还在,前提却已经坍塌了。一个压根不是人的东西,顺着刻度从头爬到了尾,最顶端的那根线也没能拦住它。
Lott还可以出更刁钻的卷子,Chollet也能接着掏出下一代ARC。
但照着AI两年半就从“瞎蒙”到满分的速度,人类的大脑里还能榨出多少道AI解不出的题,已经没人敢打包票。
等到人类题库彻底枯竭的那一天,我们要重新思考的就不只是AI到底有多聪明,还有剥掉“聪明”这层外壳之后,人类自己究竟还剩下些什么。
参考资料:
https://x.com/aisafetymemes/status/2103369359481852116
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。
艾玛·威尔逊
想了解更多以体验差异为核心,呈现游戏内容的具体观察与解读。相关内容,尽在乐鱼体育下载。
杰克·史密斯
在通过比较方法引导用户发现个人兴趣点,避免盲目赶进度。方面,乐鱼体育下载提供贴心周到的支持。