news_article.exe
📰
#GPT#Anthropic#开源#大模型

PDF当死,ARA该立!论文是时候Agent原生了

2026年8月10日3 次浏览来源:量子位 阅读原文

以后论文的第一读者不是人,而是AI?

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

啥情况?统治科研圈几十年的PDF格式,都需要因AI而“退休”…

近日,IEEE Spectrum重点关注了一项新研究——ARA(Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究,让AI从辅助工具升级为科研协作者

据IEEE报道,ARA团队在一篇名为The Last Human-Written Paper: Agent-Native Research Artifacts的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示:

一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。 现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。

PDF代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现,“有问题”。

ARA团队认为,真实的科研从来不是一条从问题直通答案的直线,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。

然而,当这些探索被写成论文时,那棵枝杈横生的“探索树”通常会被修剪成一条干净、连贯的成功路径。

而ARA团队将这种损失称为“叙事税”,即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃,后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。

模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。

研究团队统计了PaperBench中的8921项专家复现要求,发现仅有45.4%在论文PDF中得到了完整说明。

对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;

但对AI来说,论文里没写,那就意味着只能靠猜(或者瞎编),它也很无奈。

不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。

科学逻辑层:记录研究解决了什么问题、为何采用该方法,以及哪些主张可被证伪。

可执行代码层:不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。

探索图层:将实验过程还原为一张可追踪的路线图,成功与失败的方向、放弃某条路线的原因均被保留。

证据层:将论文中的每一项主张关联至原始实验结果,方便AI核验结论,而非仅采信正文中的概括性描述。

概括来说,论文最后通过PDF呈现的只是“我们最后做成了什么”;

但如果通过ARA,展现的还有“为什么这么做”“具体怎么做”“哪些方法已失败”以及“原始证据在哪里”,追求的是知识优于叙事。

道理似乎是这个么道理,但“一切存在皆合理”,PDF能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。

1、Live Research Manager:负责在研究过程中持续记录实验、决策、转向与失败路线; 2、ARA Compiler:负责将现有的PDF和代码仓库转换为ARA格式; 3、ARA原生审稿系统:负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。

为了体现ARA真的比PDF好用,研究团队分别从理解、复现和延伸三个维度进行了测试。

在理解测试中,研究人员设置了450个问题,要求AI从ARA或传统PDF加代码仓库中寻找答案。

结果显示,使用ARA的AI准确率达93.7%,而传统材料组仅为72.4%,相差21.3%。

差距最大的是“复盘失败”,当问题涉及失败方案、替代路线和实验教训时,ARA组准确率为81.4%,传统材料组仅15.7%——原因很简单,传统论文里压根就没有这些信息。

在复现测试中,团队选取了15篇附带GitHub仓库的机器学习论文,设置了150项复现任务。

其中,ARA组的难度加权成功率为64.4%,传统组为57.4%。且任务越难,ARA的优势就越明显:

ARA在简单、中等和困难三档任务中,分别领先4.9%、5.6%和8.5%。

在最具挑战性的研究延伸环节,ARA组赢下了3项RE-Bench开放任务,但另有2项被传统论文组反超。

ARA组在全部5项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作:利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。

这也对应了论文中的另一组数据。在论文分析24008次AI Agent运行中,90.2%的资金成本都消耗在失败探索上,而传统论文几乎不会保存这些失败。

在她设想的人机科研关系中,AI不再只是润色论文、查找资料或生成代码的辅助工具,而是能真正成为参与阅读、复现和延伸研究的科研主体。

而科研人员则可以更加聚焦于那些AI难以替代的判断、创新和品味工作,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。

不过,虽然ARA的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。

ARA的第一个缺陷,就是它目前实验的范围较窄,普适性较弱,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。

ARA目前不仅还没有实现细粒度的访问控制,缺少沙箱执行和内容异常检测,相关规则和标准也还没完善妥当。

要是你就这么大大咧咧地把机密数据喂给它,小心下一秒就被你的竞争对手拿走哦。

在15篇论文的复现实验中,传统材料组出现了2次结果编造,ARA组也出现了1次。

所以它目前应该既不能保证AI永远不捏造结果、也不能保证它不会过度傻白甜地相信前人的判断。

如果你需要更详细了解,建议你直接前往文末附上的论文和开源地址。

ARA研究由来自斯坦福大学、密歇根大学、卡内基梅隆大学和MIT等多家机构的37名研究者共同完成。

她是密歇根大学的计算机科学博士,深耕机器学习系统与大模型基础设施领域。

她曾参与大模型服务、训练系统和Agentic RL系统研究,也曾在Meta从事大模型预训练与后训练基础设施相关工作。

刘嘉晨的个人主页和密歇根大学官网显示,她曾在2023年入选Machine Learning and Systems Rising Stars荣誉榜单。

今年5月,刘嘉晨在帕洛阿尔托创立Agent-Native Research Lab,已经联动产学研来推动ARA Commons科研生态建设。目前,其公开成果主要包括ARA协议及论文、配套代码、研究生态构想,以及面向NeurIPS 2026的AI驱动科研生态研讨会。

实际上,这种Agent-Native的理念,也在AI狂飙这几年,正在给千行百业带来范式变革。

从PDF到ARA,一方面是AI能力的涌现,可以让整个科研过程的价值被重新发现和重视,而不仅仅是呈现一个最终的结果。

过去我们形成了PDF,是因为所有论文都是人类作为阅读者、使用者、核心对象。

但现在AI能力加持,Agent能力突破,人类看不过来的科研过程Agent可以看,人类难以并行的科研复现Agent可以复现……

以前是人类—PDF—人类,以后可能是人类—Agent—ARA—Agent—人类。

GUI已死,CLI当立… Markdown已死,HTML当立… Prompt已死,Loop当立… …… “PDF已死,ARA当立”

这更本质的是一种AI观、价值观上的哲学体现,你依然支持的是“人是万物的尺度”,还是AI才是更终极的尺度?

这无关对错,只是选择,选择的人多了,也就会在某个节点分出对错。

而ARA的提出者,显然选择的是AI为中心、Agent Native。

当然,目前为止,ARA这篇研究和论文,依然是PDF提交和呈现的。

参考链接: [1]https://spectrum.ieee.org/ai-scientist-research-paper-format?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-08-06&itm_content=hero1 [2]https://arxiv.org/abs/2604.24658 [3]https://amberljc.github.io/ [4]https://micl.engin.umich.edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars [5]https://github.com/ARA-Labs/Agent-Native-Research-Artifact [6]https://the-future-of-research-ecosystem.github.io/ [7]https://www.agenticresearch.sh/

《置身谷内》!Jeff Dean上顶会自曝离职现场:被1500人围堵2026-08-12

Anthropic CEO整天神神叨叨,投资人受不了了2026-08-12

AI倒查论文100年!99.2%的顶刊都有问题…2026-08-10

Opus 5狂烧6.9亿token做游戏,GPT-5.6用5美元复刻了2026-08-09

Kaggle八项大奖斩获其6:用于筛选和分析文献的paperai

高榕创投与红杉中国联合领投,各出资1亿美元。腾讯跟投2000万美元

DeepMind创始人最新访谈:AGI十年内降临,重塑医疗能源气候…

突发,Jeff Dean离职创业!谷歌股价应声蒸发1.34万亿

Artificial Analysis榜单:阿里Qwen3.8Agentic能力得分全球第一

MiniMax H3登顶开源社区第一,定义视频模型领域“斩杀线”

超级算力枢纽远景乌兰察布星河基地投产,全球最大AI算力超级单体落地

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

> 分享: