文章总结: 文档探讨AI在科研审稿中的能力边界与风险。AI可高效完成事实核验、代码复现等量化任务,但无法承担学术责任、判断长期价值,且易受对抗性操纵。主张AI全量前置审稿但仅限事实核验,人类终审并建立对抗自动化偏见的制度,量规制定需学术共同体参与。核心结论是AI能做科研中可计算验证的部分,但提出问题、定义价值等核心仍属人类。
综合评分: 85
文章分类: 其他
AI能参与审稿,但不能替你做研究
李林,ds&db
李林,ds&db
NUX战队
2026年10月3日 13:28
广西
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
“科研真的能AI for吗?
,可是大量科研人员都要吃饭啊。。。继续闲聊中”
第一作者评价:
这篇文章太细碎了。列了太多风险、太多边界、太多制度设计,好像非要设计一个完美方案才敢往前走。
但没有完美方案。也不需要完美方案。
核心判断其实只有一条:
AI能做好的事情,人类可以放弃。人类做AI做不了的。
可是就这篇文章探讨的主题来看,AI给的并不能让我满意,尽管我也参与了。可是我还是署名发出来了。
正文来了。
#
先说一个场景
你是一篇论文的作者。投稿后三个月,收到审稿意见。
意见很详细:指出了你方法描述中的三处模糊点,复现了你报告的两个关键实验但发现其中一个性能差距较大,还标记了三条参考文献可能不支撑你的主张。意见最后说:“建议作者补充实验细节,并核实引用。”
你不知道的是:这份意见的初稿,是AI写的。人类审稿人在它基础上做了修改和确认。
你也不知道的是:AI在生成这份意见时,引用了你论文里没有明确写出的一个假设,而这个假设恰好是你实验设计的一个隐含前提。AI没有发现这个假设有问题,人类审稿人也没有。
一致性不等于正确性。AI和人类可能基于同一套错误预设,达成一致误判。
这是AI审稿的第一个根本问题。
AI审稿能做什么
AI审稿最成熟的能力,是事实核验。
- 查重、引用真实性、图像篡改、统计异常;
- 代码执行、实验复现、性能对比;
- 文献检索、新颖性比对、贡献重叠分析。
这些任务有明确的外部锚点,AI可以做得比人类更快、更全、更不知疲倦。
在计算类学科,AI复现已达到可用水平:AutoReproduce实现约94.87%代码执行率,性能差距约19.72%;REPRO-Bench下最优AI智能体端到端复现评估准确率约21.4%,优化后提升至约71%。
但注意:代码能跑通,不等于研究结论可靠。AI复现只能核验数值结果,无法识别选择性报告、p-hacking、因果推断谬误。它是诊断工具,不是判决工具。
人文社科、纯理论数学、质性研究,这套复现流水线基本不可用。理论数学可以用形式化工具校验证明,但人文社科只能做文献核验和文本一致性检查。
结论:AI审稿的适用范围是有代码、可量化、可复现的研究。其他学科只能选择性使用部分模块。
AI审稿不能做什么
第一,不能承担学术责任
最终录用/拒稿必须由人类编辑负责。AI可以建议,但不能承担错误、造假、伦理问题的责任。
第二,不能可靠判断长期价值
AI审稿奖励的是:符合已有量规、可复现、统计干净、不冒犯主流范式的论文。
它不擅长判断:提出真正新问题、挑战共识、进入 messy 的现实、处理伦理和政治、做长期才有结果的研究。
第三,不能避免被对抗
作者可能针对AI审稿优化论文:操纵关键词密度、调整段落结构、隐藏量规偏好。学术出版是开放生态,论文和审稿反馈持续流入训练集,防御是持续军备竞赛,不是一次性工程。
第四,不能替代研究本身
审稿是判别,研究是生成。
审稿有外部锚点:论文、代码、数据、文献。研究是开放任务:问题本身还没有答案,方法还没有被设计,证据还没有被生产。
AI擅长“检查、验证、比较、找缺陷”。科研核心是“提出问题、定义价值、设计新方法、解释意外、承担风险”。
裁判再懂规则,也不能替球员踢出比赛。
如果AI写、AI审、AI改、AI评,会发生什么
会形成一个自产自审闭环。这个闭环可以无限运转,但它的目标函数是“通过AI审稿”,而不是“发现真理”。
后果是:
- 同质化:所有论文优化同一套AI审稿偏好;
- 指标游戏:作者针对AI量规优化,而不是针对真实问题;
- 回音室:AI生成内容进入训练数据,模型崩溃,知识退化;
- 责任真空:AI不能承担学术责任;
- 论文通胀:AI无限生成论文,人类注意力被淹没。
更根本的是:审稿判断“是否达到发表门槛”,研究判断“是否值得做”。后者没有统一量规。
谁来决定AI审稿的量规
这是文档之前没有触及的问题。
AI审稿不是技术中立。它背后是一套量规,而量规是人定的。
- 谁决定“新颖性”怎么定义?
- 谁决定“分析深度”怎么量化?
- 谁决定哪些缺陷是“致命”的?
- 谁训练和校准模型?
- 谁承担模型偏见的后果?
这些问题不是“技术边界”能涵盖的,它们涉及学术出版中的权力分配。
如果AI审稿的量规由少数大型出版商或技术公司制定,那么学术评价的标准就会向这些机构的偏好倾斜。非英语研究、小众方向、批判性研究,可能被系统性地低估。
AI审稿的合法性,不能只靠技术性能来证明。它需要学术共同体的参与和问责。
人类终审到底怎么做
文档说人类审稿人“逐条核验证据”。但这在现实中意味着什么?
如果AI证据包有50页,人类审稿人只有2小时,他凭什么“逐条核验”?如果AI标记了10个问题,人类审稿人只深入看了3个,剩下7个默认采信,这算“终审”吗?
自动化偏见的风险是真实的。人类审稿人倾向于采信AI整理好的证据,尤其是当证据包看起来很专业、很全面的时候。
对抗自动化偏见,需要具体的制度设计:
- 强制质疑点:AI证据包必须包含“本结论依赖的关键假设”,审稿人必须对这些假设逐一表态;
- 随机复核:系统随机抽取AI标记的问题,要求审稿人独立复核,复核结果与AI不一致时触发进一步审查;
- 分歧记录:审稿人不同意AI判断时,必须写明理由,理由进入审计日志;
- 时间保障:如果AI证据包超过一定篇幅,审稿人审稿时间必须相应延长,否则系统拒绝接收审稿意见。
这些制度设计不是技术问题,而是学术治理问题。
很多研究害怕AI,不只是因为脱离现实
有一种流行观点:害怕AI的研究,本质是脱离现实的文本型工作。这个判断有部分道理,但不够完整。
学界对AI的警惕分为两类:
第一类:高度模板化、以发表为唯一目标的研究,确实容易被替代。
研究问题从文献缝隙中来,方法模板化,结论不进入现实检验,评价标准是期刊等级和引用数,写作有固定八股。这类工作的核心产出是文本,AI可以高效生成同类成果。
第二类:严肃研究者对学术系统风险的合理担忧。
- 版权与训练数据风险;
- 学术马太效应加剧,经费充足的团队使用更强AI工具;
- 模型偏向主流范式、英文成果,低估小众方向;
- 隐性造假难以识别,精巧的数据操纵隐藏在看似干净的实验结果内;
- 评价过度量化,挤压思辨类、长期探索型研究。
这两类恐惧不能混为一谈。把第二类也归为“研究脱离现实”,是一种价值独断。
科研真的能AI for吗?
要回答这个问题,得把“AI for Science”拆成三层。
第一层:AI作为工具
这是最成熟、最没有争议的一层。
文献检索、数据分析、实验设计优化、模拟仿真、图像识别、代码生成,AI已经在这些环节大规模使用。AlphaFold、材料筛选、药物分子生成,都属于这一层。
这一层已经真实发生,而且不可逆。
第二层:AI作为合作者
AI开始参与假设生成、实验设计草案、论文初稿、内部评审、复现验证。
这一层部分可行,但必须有人类终审。AI可以提出候选假设,但无法判断哪个假设值得投入三年去验证。AI可以设计实验,但无法判断这个实验是否符合伦理、是否值得做。
第三层:AI作为自主科学家
这是“AI for Science”口号最激进的理解:AI自己提出问题、自己设计实验、自己解释结果、自己写论文、自己审稿,形成闭环。
这一层只在极窄的可形式化领域有部分可能,比如数学猜想搜索、算法优化、形式化证明、封闭规则下的博弈、有明确目标函数的分子筛选。
一旦进入开放世界、现实干预、伦理判断、因果解释,这一层就基本不成立。
所以,科研可以AI for,但不能AI替。
AI for的是科研中可计算、可验证、可规模化的部分。科学的核心——提出问题、解释意外、承担风险、赋予意义——仍然是人。
真正不可替代的研究,扎根于无法完全形式化的现实
现实世界包含复杂经验、人的处境、不可逆决策、意外异常、长期连锁后果。
这类研究要求研究者进入现场,承担风险,做出价值判断,并为错误承担责任。
AI可以辅助证据收集,但无法承担这份责任,也无法定义研究的意义。
结论
- AI审稿应全量前置,但仅限于事实核验环节:合规筛查、文献比对、代码复现、多智能体交叉质询。完整流水线仅适用于量化实验与形式化学科;人文社科仅可使用部分文本核验模块。
- AI输出结构化证据包,清晰区分事实、推断、不确定性;不输出单一录用/拒稿分数作为最终结论。
- 人类审稿人承担终审判断,从重复的事实核查中解放,聚焦价值判断、争议仲裁、伦理风险评估。同时建立对抗自动化偏见的具体制度。
- 编辑掌握最终裁决权,配套完整申诉与AI推理审计机制。
- AI不能替代原创科研:它可以辅助生成论文,但无法判断什么问题值得探索。
- AI审稿的量规制定权,必须由学术共同体参与,不能由少数技术公司或出版商垄断。
一句话:AI负责大规模检索、核验、复现与文稿打磨;人类负责定义问题、判断价值、承担学术责任、仲裁争议。
但还有一个问题没有回答:当AI审稿成为学术出版的基础设施,谁来决定这套基础设施的规则?
这个问题,不是技术能回答的。
注:ds为deep seek,db为豆包。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:NUX战队 李林,ds&db
李林,ds&db《AI能参与审稿,但不能替你做研究》