Accelerating scientific discovery with Co-Scientist
Co-Scientist 把科学假设生成做成多 agent 系统:多个 agent 持续生成、批判、排序和改进假设,并通过 test-time compute scaling 提升假设质量。 系统面向研究目标和既有证据生成可实验验证的新假设;论文在药物重定位、新靶点发现和抗微生物耐药机制解释中验证,特别是 AM...
papers.dast.ai
改变范式的前沿研究:Agent、记忆、具身智能、多模态与生成式 AI,脑与认知启发,AI 医学/数学/物理/化学,以及 AI 硬件与软硬件协同。
EDITORIAL SELECTION
优先呈现范式级与颠覆级工作。每个页面提供收录依据、边界、原始论文链接及已公开的讲解视频。
Co-Scientist 把科学假设生成做成多 agent 系统:多个 agent 持续生成、批判、排序和改进假设,并通过 test-time compute scaling 提升假设质量。 系统面向研究目标和既有证据生成可实验验证的新假设;论文在药物重定位、新靶点发现和抗微生物耐药机制解释中验证,特别是 AM...
Robin 把文献检索 agent、假设生成、实验建议、数据分析和结果解释连接成 lab-in-the-loop 的科学发现系统,而不是只做单点文献问答或代码生成。 论文在干性年龄相关性黄斑变性场景中验证了系统:Robin 提出增强 RPE 吞噬作用的治疗策略,识别并体外确认 ripasudil 与 KL001...
社会科学实验昂贵且周期较长,研究者通常需要通过小规模预实验或人类预测来筛选干预方案、估计效应并确定后续实验优先级。本文研究大语言模型能否在无法直接接触实验结果的条件下,预测随机调查实验的处理效应,从而辅助实验设计与资源分配。 作者没有要求模型直接猜测论文结论,而是给模型提供虚拟参与者的人口统计资料、实验刺激和结...
可容错量子计算不仅要求纠错码能够检测和修正错误,还要求大量模拟控制参数在长时间运行中始终保持校准。传统的停机重校准会打断计算,难以支撑可能持续数天或数月的量子算法,因此需要一种能够在量子纠错持续运行时自动追踪器件漂移的闭环控制机制。 论文把量子纠错电路产生的 detection events 同时用作解码信号和...
膜蛋白的结构解析和疫苗开发因其广泛的疏水表面而面临巨大挑战。本文提出了一种基于深度学习的通用设计方法,用于增溶天然膜蛋白,同时保留其序列、折叠、活性位点和配体结合特性。 核心方法是利用深度学习(RFdiffusion)设计基因编码的de novo蛋白——WRAP(水溶性RFdiffused两亲性蛋白),它们包裹...
数字病理学中,从全切片图像预测生物标志物面临计算效率低下的问题,现有方法处理大量冗余图块并需要复杂聚合模型。 本文提出EAGLE框架,模仿病理学家选择性分析信息区域,结合任务无关的图块选择与详细特征提取。 在涵盖9种癌症类型的43项任务上,EAGLE相比图块聚合方法性能提升高达23%,每张切片处理仅需2.27秒...
血液恶性肿瘤的诊疗决策高度依赖多学科肿瘤委员会,涉及纵向治疗史、分子分型和快速演变的临床证据,但专业决策资源的可及性日益不均。 本文开发了HemaGuide,一个可本地部署的模块化大语言模型代理,能够将非结构化临床文档转化为结构化病例表示,自主将病例路由至特定决策模式(指南、高级、分子),并基于疾病特异性指南流...
EnterpriseClawBench是首个从真实企业工作会话中构建的智能体基准,包含852个可复现任务,每个任务配有恢复的工作环境夹具、重写提示、角色类别、技能子类、强制规则和语义评分标准,覆盖文件处理、工具调用和业务工件交付等真实企业场景。 在人工审核的120任务精简子集上,32种harness-模型组合中...
这篇 Nature 论文把医学 LLM 从问答式临床建议推进到 EHR 集成的 autonomous medical agent:模型不是只生成文本,而是在沙盒电子病历环境中执行受治理的结构化临床动作。 MIRA 能获取病史、下单并解释实验室/影像/微生物检查、生成鉴别诊断,并提出处方、手术、入院等计划,体现出...
这篇论文提出 WEAVER,把机器人世界模型从单纯视频/状态预测推进到可用于策略评估、策略改进和测试时规划的多视角模拟器。 核心方法是 multi-view latent world model:用 flow-matching 预测未来 latent 与 reward,并把架构、记忆和预测目标设计为同时满足 f...
这篇论文把数学证明能力组织成生成、验证、修复、排序的 test-time population search。 核心贡献是 generative-verifier RL 与低假阳性 verifier 结合,使同一模型在测试时承担 generator、verifier、refiner 和 ranker。 它值得收...
This paper evaluates LLM-driven formal proof search on open mathematical problems, using Lean-style formal verification as the reliability layer for generat...
ERA 针对科学研究中的一个真实瓶颈:研究软件和实验脚本往往需要专家长期手写,限制了计算实验迭代速度。 系统把 LLM 与 tree search 结合,以质量指标为目标反复生成、测试和改进代码;论文报告它在单细胞分析、COVID-19 住院预测、地理空间分析、斑马鱼神经活动预测和数值积分等任务中达到或超过专家...
这篇 Nature Medicine 论文来自 Google/DeepMind 医疗 AI 路线,提出 multimodal AMIE:在诊断对话中主动获取、解释并推理患者历史、皮肤照片、心电图和临床文档等多模态信息。 方法重点是 state-aware dialogue framework:系统根据诊断不确定...
这篇论文的重要性不在于又提出一个 hallucination 检测器,而在于它把问题上提了一层:当前主流训练和评测流程本身就在奖励不该有的猜测。作者指出,next-word 预训练会天然把模型推向“尽量补全”而不是“诚实承认不知道”,而准确率导向的 headline metrics 又在后训练和榜单上继续放大这...
这篇 Nature 论文把模型训练数据中的隐藏信号问题从普通数据污染推进到可复现实验现象:教师模型的行为特质可以通过语义上无关的数据传给学生模型。对本仓库来说,它是模型安全、蒸馏、合成数据训练和数据谱系管理的核心风险条目。 论文展示了即使数据中显式 trait 线索被严格过滤,学生模型仍可能学到教师偏好或不对齐...
这篇 Nature 论文把钙钛矿太阳能电池研发从人工试错推进到机器学习材料发现与自动制造平台闭环结合的路线。核心不是单点预测,而是把候选分子发现、器件制备和工艺反馈统一到自主优化系统中。 系统用 active learning 和 quantum modelling 快速筛选高性能钝化分子,并用 Bayesia...
大型语言模型(LLM)经过对齐训练后仍然脆弱:越狱攻击可以轻易绕过安全护栏,而在特定领域进行微调会引发广泛的"涌现性错误对齐"。这一现象是否源于模型内部对有害内容缺乏连贯的组织结构,此前一直不清楚。本文通过权重剪枝这一因果干预手段,系统性地探究LLM内部有害性的组织方式。 研究发现,有害内容的生成依赖于极为紧凑...
没有匹配的论文。