开源 AstaBrief:Asta 平台中的快速科学报告生成模型
语言模型在辅助研究人员搜索文献、综合证据及解决复杂问题方面已展现出显著价值。然而,科学研究对模型提出了独特要求:答案必须严格基于证据,模型需忠实保留证据支持的范围,避免过度推断,且最终结果需具备可验证性。

Ai2(Allen Institute for AI)团队观察到,科学家在使用其智能平台 Asta 时,往往提供包含大量上下文和多重约束的查询,例如要求比较特定方法、人群或环境下的整个文献体系。此外,生成的报告常被视为研究成果的一部分,而非一次性回答,用户会反复审视这些内容。
为提升效率,Ai2 测试了专为科学报告生成训练的小型开放权重模型,旨在使其报告质量匹敌专有模型。由此诞生了 AstaBrief 8B,该模型能将研究问题和文献摘录转化为带引用的报告。目前,AstaBrief 作为“快速模式”集成于 Asta 的报告生成功能中,与由 Claude 驱动的“思维模式”并行使用。模型权重及训练数据均已开源。
开发过程涉及数以万计的真实研究查询、以引用为中心的数据过滤、偏好数据构建以及报告生成管道的重新设计。结果显示,相较于 Ai2 跟踪的专有模型,AstaBrief 将报告生成时间缩短了近一个数量级:快速模式平均耗时 51.1 秒,而思维模式为 178.5 秒,速度提升约 3.5 倍。
这一效率提升使 AstaBrief 成为构建适应科学工作特定需求的开放语言模型的实验案例。开放权重允许机构在本地基础设施上运行模型,这对于处理敏感或未发表的研究数据至关重要。除了模型权重,Ai2 还发布了一个示例工作流程,帮助研究人员从 PDF 文件中创建报告,为本地化报告生成提供参考。
需要注意的是,文中描述的大部分训练和评估工作在 2025 年完成,因此用于生成训练数据和作为对比基准的专有模型反映的是当时的前沿水平。尚未根据当前最新的前沿模型重新进行完整评估,以下结果主要体现特定训练和系统设计选择的效能。
模型训练策略
AstaBrief 的目标是建立一个具备长篇科学综合核心特质的开放权重模型,重点在于答案质量、相关性、结构完整性及引用依据。团队以 Qwen3-8B 为基础,将精力主要集中在训练后的数据处理、评估体系及报告生成架构上。
调整通用模型以适应科学工作与从头训练新模型是 Ai2 探索的重要方向。通过 NSF OMAI 项目,研究人员正与科学界合作,明确未来开放模型的需求及当前通用模型的缺陷,包括不同科学领域和工作流程间的需求差异。
尽管近期研究如 DR Tulu 表明,结合法官模型的强化学习(RL)方法能改善开放权重模型的长形式报告生成,但 Ai2 团队最终选择了围绕监督微调(SFT)和直接偏好优化(DPO)构建的更简单配方。鉴于 RL 训练可能不稳定且成本高昂,团队希望通过更经济、易操作的设置来提升质量。
这使得训练数据的质量变得尤为关键。与其依赖复杂的优化方法来弥补噪声样本,团队花费大量精力优化数据的生成、选择和过滤流程。此外,为提高速度,AstaBrief 被训练为直接根据用户查询和相关检索片段生成最终报告,绕过了基于 Claude 的思维模式中昂贵的片段总结和聚类阶段。实验证明,这种简化路径并未损害性能。
SFT 训练数据收集
训练流程始于通过论文所述系统提交的真实用户查询。该框架结合了检索增强型 LMS 和 ScholarQA 合成科学文献,支撑着 Asta 的报告生成功能。团队希望 AstaBrief 能从真实科学家那里学习。
分析显示,科学家对语言模型的要求不同于普通聊天机器人用户。在数十万个 Asta 查询中,专家研究人员通常提供实质性上下文、多重约束和概念关系,而非简短的关键字提示。用户研究还发现,研究人员对 AI 参与方式的偏好各异:部分人倾向于创意或实验辅助,另一部分则偏好合成、文献监测等狭窄任务。参与者普遍要求更清晰的源可追溯性和更高的模型透明度。
团队对用户日志进行了严格过滤,排除测试者、机器人流量、过短无意义查询,并利用基于 LLM 的过滤器捕获非英语、非科学请求及含个人信息的提示。最终保留了 9 万个以研究为重点的查询。
对于 SFT,团队利用 Asta 背后的多步 ScholarQA 管道从过滤后的查询中生成目标输出。该管道检索相关文献,组织材料并综合证据生成带引用的报告。过程中使用了多种专有系统,包括 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量筛选,最终得到 4.7 万个可用训练示例。
构建偏好数据对
DPO 训练需要成对的报告数据,其中一份比另一份更受偏好。这些数据来自未用于 SFT 的独立查询子集。每对中的一份报告来自现有的 ScholarQA 管道(通常由 Claude 3.5 或 3.7 Sonnet 支持),竞争报告则由其他模型生成,包括 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1。
GPT-4.1 和 DeepSeek-R1 作为评审模型比较每一对并选出赢家。为确保 LLM 法官与人类偏好一致(达到 95% 一致性),团队仅保留两位法官都同意的配对。这种方法构建了相对清洁的偏好集,减少了大规模生成偏好数据中常见的噪音。最终 DPO 数据集包含约 6K 个例子。
使用多个生成器并要求双法官达成一致,提供了一种无需将任何单一模型输出视为绝对真理即可构建偏好数据的简洁方法。
数据过滤与归因改进
主要评估基准为 SQABench-CS2,包含 200 个用户编写的计算机科学研究问题。开发过程中追踪了四个指标:
- 标题分数:衡量报告涵盖必要内容的程度。
- 答案准确度:衡量每个段落与问题的相关性。
- 引用精度:衡量每个引用是否支持其所附带的声明。
- 引用回忆:衡量报告声明是否完全得到所引文献的支持。
最终模型还在 DeepScholarBench 上进行了二次评估,这是一个基于最近 ArXiv 论文的 63 个查询长篇研究综合基准。
科学综合要求模型不仅听起来完整,还要避免偏离问题或附上不支持的证据。即使引用正确,模型也可能做出比原始研究更强的声明,例如将特定样本的发现泛化为整体人口结论,或将过去报道转化为普遍现状陈述。这些细微的概括在科学报告中尤为重要,因为它们可能在技术上关联来源的同时夸大实际确定的范围。
初期模型在答案准确性和引用质量上仍落后于 Claude 驱动的流程。为此,团队测试了四种基于统计信号的过滤器来识别较弱的合成训练示例:
- 输出与输入代币比率:高比例往往意味着从太少证据中生成了过多文字。
- 引用的相关性:低平均值表明报告过度依赖低等级证据。
- 引用密度:测量至少有一次引用的陈述份额。低密度报告常包含大量未经支持的文本。
- 引用多样性:测量答案中引用的论文份额。低分数表明报告过度依赖少数论文。
过滤掉引用密度较低的综合报告带来了最大收益,而更激进的组合过滤和学习率扫描并未增加显著好处。这表明简单的信号——即报告是否始终为其声明提供引用——比复杂的组合更有效。科学专业化并非单纯增加预训练科学文本的问题,而在于训练后数据的组成、质量及其表现出的接地和归因行为。
这一发现与 Asta 用户研究结果一致:参与者认为创建更多文本并不一定更有帮助,他们更需要简洁的综合和足够的源可追溯性以便审查验证,而非不必要的冗长输出。
在获得更强大的 SFT 检查点后,团队在其上进行了 DPO 训练。这一阶段进一步提升了性能,使 AstaBrief 在报告生成方面接近 Asta 和 DR Tulu 的 Claude 驱动报告管道水平。
方法验证与用户反馈
由于 AstaBrief 旨在作为 Asta 代理报告生成框架的一部分,核心问题是它能否在实现更快、更便宜报告生成的同时保持所需的质量。这不仅关乎匹配强大专有模型的能力,更关乎用更简单系统保留多少质量。
注:Qwen3-8B 仅在 SQABench-CS2 测试中评估。SQABench-CS2 为用户编写的计算机科学问题集;DeepScholarBench 使用独立指标评分,两者不可直接比较。
在开发过程中的评估里,AstaBrief 在答案和引用质量的多个指标上与 Claude 驱动管道及 DR Tulu 竞争激烈。在一项针对 14 个问题的人类研究中,三位科学研究人员每人贡献 4-5 个问题,并对总体偏好、完整性、相关性、组织和引用准确性进行排名。虽然 DR-Tulu 在总体偏好上获胜,但三名研究人员中有两人更喜欢 AstaBrief。
注:图示为各系统与思维模式相比获得的 LLM 评估报告比较份额。人类判断单独评估,未包含在内。AstaBrief 在 DPO 阶段被优化为对报告排名。
这些数据应被视为工程方法的验证,而非关于基础模型相对于当前边界位置的定论。模型生态系统发展迅速,数据构建、归因过滤和服务教训更具推广价值。
在实际应用中,快速模式显示出鼓励早期使用的潜力。在尝试过的 374 名 Asta 用户中,29.1% 使用了两天或更长时间。23% 的用户持续使用快速模式且未切换回思维模式,另有 18% 根据目标在两种模式间切换,其线程中约 40% 使用快速模式。尽管反馈数据较少,但快速模式与思维模式获得的积极反馈率相似(84.2% vs 85.2%)。
未来展望
Asta 的报告生成是 AstaBrief 的首个生产应用,它为研究人员提供了与现有思维模式并行的开放权重快速模式。由于模型开源,机构可在自有硬件甚至防火墙内部署,无需依赖专有模型 API。
这也意味着团队可以直接研究和改进报告生成管道的这一环节。未来工作包括探索更精细的偏好学习、更强大的 RAG 加 RL 方法、多轮和多工具功能、额外科学数据来源及查询分解。评估重点将从单纯的引用支持扩展到模型是否保留证据范围,包括简洁性、组织性以及是否避免将特定样本发现转化为广泛概括。
AstaBrief 是 Ai2 科学语言模型长期工作中的一环,连接了 ScholarQA、DR Tulu 到未来的 Olmo 版本。其在训练数据、过滤和评估方面的经验将为后续模型构建提供重要参考。





