铭鸿体育资讯网

AI论文盲审拿6.33分,排人类投稿前45%,差点被顶会接收 一篇AI写的论文,

AI论文盲审拿6.33分,排人类投稿前45%,差点被顶会接收
一篇AI写的论文,混在40篇人类投稿里盲审,拿下6.33分,越过接收线,排进全部投稿的前45%。如果没人提前打招呼撤稿,这篇AI写的论文已经被顶级学术会议ICLR正式接收了。比一半的人类竞争者都强,而这篇AI写的论文连一杯咖啡都不需要。
别急着说这是哪部科幻电影的预告。这篇AI产出论文通过同行评审的故事被Nature报道了。一个叫 The AI Scientist 的系统,从头到尾独立产出一篇机器学习论文,通过了真实同行评审。不是科幻片,就发生在最近。
过去,AI在科学界是个专才,比如预测蛋白质结构,比如筛新材料,做的是流水线上的单道工序。这次不一样,The AI Scientist 系统接管了整条科研流水线,像一支被压缩进代码的科研团队——批量产生想法,自动联网查重过滤,兵分多路写代码、跑实验,遇到故障自己修。
干完了,填入论文模板,相关工作一节就迭代了20轮。最后用自带的AI审稿人,按顶级会议标准打分把关。

最狠的是那个图灵测试。团队把三篇AI论文混进40篇人类投稿里盲审,评委会什么背景信息都不知道。一篇关于组合正则化的AI论文拿了6.33分,直接越过接收线,排在全部投稿前45%。
组织者说了,要不是事先约定评审后撤稿,这篇关于组合正则化的AI论文已经正式被接收了。
但先别急着焦虑,团队自己承认The AI Scientist 系统毛病不少。想法稚嫩,会编造文献,三篇里只有一篇过线,而且够不着顶会主会的门槛。不过,有两个趋势值得警惕。
第一,AI论文的质量正随模型迭代稳步爬升。第二,AI能独立完成的研究体量,大约每7个月翻一倍。7个月翻一倍,一年翻两倍多,三年就得翻二十多倍。
那我们的工作还保得住吗?

再看这AI盲审实验的另一面,仔细想想,定规则的人始终是人类。征得科研伦理许可、走审查流程、主动撤稿,每一步都是人在做决定。人类在给AI划定边界,让AI证明自己,但不让AI越界。
未来不会被替代的,是驾驭AI的人——能把复杂的创造拆解成可执行步骤,并且为最终结果负责的人。论文可以是AI写的,但决定投不投,投去哪,何时撤,始终是人。
AI能做的活体量每7个月翻一倍,但科研里有大量“AI做不到”的部分:提出一个有品位的问题、判断什么值得研究、识别AI编造的文献、在失败中嗅到新的可能性。
这些都需要人。关键是,AI压缩了从想法到实验验证的中间环节,那些曾耗费科研人员大量时间的重复劳动,正在变得越来越廉价。
浙大发布的“求是引擎”能连续自主运行十几个小时,走完科研全流程,而同样体量人工要数周甚至数月。
这是实实在在的科研范式转型,学界有人叫它“从人类主导到人机协同”的拆解与重建。但严格来说,眼下The AI Scientist 系统这类AI工具在端到端科学发现这类任务上的完成率还远达不到编程领域那样的熟练程度。
眼下The AI Scientist 系统这类AI工具还只是个能干的助手,谈不上颠覆者。

真正的问题不是人类会不会被替代,而是当AI每7个月就能多做一倍科研活,人类要跑到多快才能站在AI前面?那篇拿6.33分的关于组合正则化的AI论文,排在40篇人类投稿的前45%,这只是一个起点。下一次盲评,你手里的方案,还排在哪?