首页财产ai正文 本年高考,我让12个AI一路考了语文及数学 高考季用天下一卷试题周全测试主流年夜模子的语文及数学,约请4位高中教员阅卷,限定法则包管公允,终极患上出各模子成就和排名。 2026-06-08 14:23 ·微信公家号:数字生命卡兹克 卡兹克 卡兹克 AI投资人解读· 文章对于主流年夜模子举行语文及数学高考题测试,约请4位高中教员阅卷,终极患上出各模子成就。此中MiMo v2.5 Pro总分第一,为256.3分,Kimi k2.6以0.01分之差位列第二。 · 测试成果受多种因素影响,如教员主不雅评分、模子答题体现等,且这次测试与模子代码及Agent能力无关。 总结:这次年夜模子高考测试具备必然意见意义性与参考价值,但成果有局限性。建议连续存眷年夜模子于差别范畴的成长,评估实在际运用潜力与危害。内容由AI天生,仅供参考
一年一度的高考季又到了。
从上上周最先,就有许多伴侣来问我,本年高考还有测意外年夜模子测验了。
测,必定测。
可是必定要跟去年要有一些区分对于吧,去年我只测了部门的数学题,本年要是还有这么玩,那就太无聊了。
以是,我想了想,本年不如整个年夜一点的活,让所有的*AI一路,来周全的考一下语文及数学,这两个,全都考。
于所有AI都于发力代码及Agent能力的环境下,毕竟谁的语文能力最高,我还有长短常好奇的。
此次的参赛模子呢,基本市道上主流的年夜模子我也都拉来了,基本都是各人的旗舰模子。
外洋基本就是各人认识的御三家,Claude Opus 4.八、GPT-5.五、Gemini 3.1 Pro。
海内这边,我也只管即便选了各家此刻最能打的。
千问3.7 max、文心Ernie 5.一、星火Spark X二、智谱GLM5.一、Kimi k2.六、MiniMax M三、DeepSeek V4 Pro、小米MiMo v2.5 Pro、混元3这些都有。
让这些年夜模子,一路做了这两套卷子。
而我必定没有对于语文及数学高考标题问题阅卷的能力,以是此次,我想了想,找身旁的伴侣们化了下缘,终究,也约请到了4位有过近似阅卷履历的高中教员们,来跟咱们一路整这个活。
由于语文会轻微主不雅一点点,而且咱们也不像真的高考同样有一些打分细则,以是咱们约请了3位语文教员来配合阅卷,让他们充实阐扬,末了取平均分,如许会公允一点,以是终极是3位语文教员及1位数学教员。
可是真的很是很是感激几位教员,陪咱们一直干到了凌晨,每一个人险些都当真修正了十二份的卷子。。。真的,无以为报。。。
而卷子的遴选上,虽然也都是选用的天下一卷,此次会轻微有点非凡。
由于语文此次比力惋惜,比及晚上8点也没有比及完备版的卷子,以是只能终极利用中国测验官方发布的部门试题及参考谜底长进行测试,满分年夜概是100分,终极分数会基在比例,再换算至150分。
数学则是完备的真题试卷,就比力简朴了。
然后呢,为了包管此次AI高考的公允性,咱们还有是下了不少功夫做均衡的,限定了不少法则:
1. 利用API挪用各个模子,都开thinking,不限定最长的token数,所有的东西挪用都强行禁止,像甚么代码推理、网页搜刮甚么的都关失了。
2. 除了了讯飞星火、baidu,其他10家同一走OpenRouter挪用,如许可以包管最公允公道。
3. 模子的输入,语文及数学都采纳了经由过程LaTeX格局纯文本输入的方式。
数学原来咱们筹算是分成多模态及纯文本赛道的,可是真题一出来以后,发明只有一道题,也就是立体几何那道题带图形。但题干实在就彻底包罗了这个图形的所有信息,没有须要,以是就改为了全数都经由过程LaTeX格局输入。
虽然PDF转LaTeX格局这一步是AI做的,可是让它转了以后,我也一样写了一个LaTeX编译器的剧本,它会于左侧放上原有的标题问题,右侧是LaTeX数据编译后的终极标题问题,利便我及教员们举行查对,于正确性上,咱们还有是花了一些力气的。
然后咱们也开发了一个本身的测验剧本,咱们只需要把标题问题丢进去,剧本就会主动调 API,主动让模子作答,主动把客不雅题判失,主不雅题再送到我搭的于线阅卷平台里,让真人教员盲评。
测验的Prompt根据下面的设置给模子。
客不雅题只是纯真限定它的格局输出,利便我的剧本对于客不雅题举行打分,不做任何的指导。
主不雅题就直接把裸题给模子丢已往让他作答。
以和于数学的填空题上面,也是让它按照数值打分,不是按照格局打分。由于填空题轻易呈现,于分数或者者说有根号的环境下,会有差别的写法,统一个数值会有差别的写法。以是此次于剧本中也是有非分特别留意这一点。
横竖作答上咱们只管即便确保要公允、公允再公允,客不雅、客不雅再客不雅。
末了,模子输出的所有的成果,咱们又开发了一个阅卷网站,供咱们的4位教员们举行阅卷及评分。
教员利用本身的名字,登进去以后,看到的每一份卷子上面只有一个代号。卷ABCD巴拉巴拉。
如许的话,教员其实不知道这道卷子是哪个模子做的答,也会防止一些前置的刻板印象带来一些阅卷上的影响。
教员可以随便选择一套卷子最先阅卷,然后内里的打分界面是如许的。
直接于内里逐题修正。
还有可以写上本身的考语。
真的,教员们尤其辛劳,由于语文的卷子迟迟不出终极版,以是咱们末了只能用部门版来测验,几位教员都生生的阅卷到晚上11点之后了。
向教员们致敬。
末了,于履历了快要12个小时的奋战以后,咱们的12位年夜模子的测验分数,终究出炉了。
他们,是如许的。
这里我提早叠个甲,这个分数及排名,只是咱们基在本身的系统做题出来而且由教员们主不雅评比出来的,并且只跟语文及数学做题有关,跟各人此刻会商的代码及Agnet能力无关,且可能会展示部门的人类偏好,排名与分数仅供文娱参考,不代表任何指向。
这内里有几个让我挺不测之处。
先看总分,*名MiMo v2.5 Pro,256.3分。第二名Kimi k2.6,256.29分。
差了0.01分。
MiMo比Kimi语文少了1分,Kimi数学比MiMo少了1分。。。
要知道咱们测评的语文卷子只有一道客不雅选择题,其他全是主不雅题,再加之有作文的存于,换算到现实评分上,可能就是某位语文教员于某道主不雅题上多给了1分的区分。
往下看从第三名到第九名,Claude Opus 4.8,一直到GLM 5.1及Gemini 3.1 Pro并列的252.78,7个模子之间的差距仅仅于2分。
可以说,至少于这两套高考卷子上的体现,前面这9个*的AI年夜模子模子险些真的都拉不开差距了,分差极小。
看完了总分,再来看看单科的成就。
你会发明,咱们的语文状元于3位教员盲测中,由GLM5.1及Gemini 3.1 Pro配合摘夺桂冠,可是于数学上又有点偏科,并且险些都是兄弟肩并肩,我的脑子里已经经呈现了中学班上某一个同窗的样子了。。。
反过来的例子也有,DeepSeek V4 Pro,及MiMo、ERNIE 5.1三家并列数学最高分,但语文又奇低。。。
坦率的讲,这实在不太切合我对于DeepSeek强世界常识的印象。
我把语文的评分零丁拎出来看了下,这里留意一下,由于语文真标题问题前全数的还有没出来,以是此刻用的是部门的题调集成的101分版本,末了折算成150分制的,以是下面你看到的总分实在都是101分制的。
发明DeepSeek的作文,属在拉完了。
末了一名教员手比力松,虽然打出的分数是49分,可是于他已往的打分中,实在也不算高了。
他们的考语实在也都很是的成心思。
以是他们一改完卷,我也去当真看了看他们所有的考语。
实在三位教员从给分上看,是能看出来他们有各自的偏好,可是于他们的考语有一个配合点。
他们很于意高考作文的可评分布局。
考语里会高频呈现体裁不清,文章布局不敷清楚,不雅点不敷清楚明确,论证不充实,时代联系关系不足等等考语。
好比这一篇所有模子中患上分最高的,由GLM 5.1写的作文,就有两位教员都提出了文章布局不敷清楚的弊端。
作文原文我也放于这里了,各人可以于评论区评一评。
语文年夜概就是如许,咱们再看看数学的患上分明细。
你会发明险些所有的模子,实在没啥年夜的分差。
我也从数学教员那里获得了很是踊跃的反馈,刚改完前面几个年夜题,他就于很高兴的跟我说,发明准确率挺高的,基本都是满分。
可是要领会纷歧样。
重要是于几何上,这个就颇有意思了。
还有有一个成心思的就是,我于让Opus 4.8跑数学末了一道年夜题的时辰,他稀里糊涂的卡死了许多许多轮。。。
不太成心思的就是,我健忘它一直于重试,致使我OpenRouter上为数未几的余额全给耗光了。。。
不外末了好歹还有是弄出来了。
以上,年夜概就是此次AI高考的成果,跟我最最先预期的,还有真的是有点区分。
我又做了一下各家的位置图,各人可以看看。
真的是情理之中,又是预料以外。
还有挺好玩的。
突然又想起,2023年,我*次拿高考题去测AI。
其时是让ChatGPT去写高考作文。
那会儿GPT-4还有是最能打的,国产模子甚至都还有没有几个。
2024年,国产也最先卷起来了,但还有是有许多啼笑皆非的翻车。去年2025那次测完,有几个模子的数学程度已经经够上一本线了。
本年是2026。
四年了。
也算是见证了那很多多少很多多少个模子的浮沉。
咱们本身也于变,23年的时辰,只会写个作文,去年测试,还有是人工复制粘贴到十几个年夜模子的官网内里去测试,不停的roll。
本年,写批量剧本,写LaTeX转译,请高考阅卷教员们助阵,又为他们徒手开发了阅卷网站。
我固然也能够顺手测一下整个活,可是想了想,这几年,于这个选题上,我感觉还有是要尽可能的包管客不雅及公允。
由于,这是高考。
这两个字,于中国,承载的工具太多也太厚重了。
做阅卷网站的时辰,我一直于纠结用甚么主张象,末了选了凤凰花。
六月的凤凰花开患上正盛,每一年都准时赶于这个节点上,送走一届又一届的人。
末了。
我想用近来一段对于我很是有感慨的话来末端,它来自《燕云十六声》近来更新的青州舆图的末了的使命,当一众学子行将卒业之时,文津馆文元林险生对于各人说:
“你们,自不着边际负笈而来,今日散去,又是去往不着边际,今后山长水远,许多人将不复相见了。
此去,必有风霜凛凛之时,愿诸君,乾坤既年夜,草木尤青,本旨择路,埋头前行。
列位,一起顺风。”
【本文由投资界互助伙伴微信公家号:数字生命卡兹克授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-雷火·竞技