形式化数学系统开始把“证明正确”与“提出值得证明的问题”分开评估
新的评测不再只统计最终定理是否被证明,而是单独记录猜想生成、证明搜索和人类可读解释,让数学发现中的不同能力不再被一个总分吞掉。
它改变的不是排行榜名次,而是我们如何定义“AI 在做数学”。
新的评测不再只统计最终定理是否被证明,而是单独记录猜想生成、证明搜索和人类可读解释,让数学发现中的不同能力不再被一个总分吞掉。
它改变的不是排行榜名次,而是我们如何定义“AI 在做数学”。
预印本、代码仓库、模型权重与湿实验验证被折叠为同一个研究事件;读者不必在六篇报道之间重新拼接证据链。
重点不是又一个更大的模型,而是计算产物和实验结果能否被第三方检查。
“更准”的宣传语被拆成评估对象、基线、空间外推与极端事件表现,避免把平均误差的改进写成普遍可靠。
科学信号是评价单位变化:从平均榜单转向模型究竟会在哪里失效。
Agent 演示、实验设计、机器人执行与真实测量被分开记录,一个流畅的研究故事无法再遮住断掉的证据链。
这决定“AI Scientist”是界面演示,还是能对真实科学发现产生增量的系统。
JUAN'S NOTE · 人工判断
当传感器和视觉模型让 detections 暴增,评价分母应是经独立复判的 site × season × taxon 有效覆盖,而不是设备或文件数。
失败实验被纳入评价后,模型是否真的缩小搜索空间,终于可以与事后挑选的漂亮案例区分开。
新结果把不同测序平台和实验室之间的性能落差单独列出,提醒读者不要把同分布测试当作通用生物学能力。
聚合准确率被拆开后,模型对常见鸟类的优势不再掩盖对稀有物种和雨季声景的系统性漏检。
这类过程记录让协作贡献不再只剩最终作者名单,也为未来评估自主程度提供更可靠的基础。
没有匹配的事件,换一个关键词试试。
TOPICS
机构、人物、科学领域与模型
ORGANIZATIONS · 01
研究机构、公司与非营利实验室。
数学、生物、天气与材料中的基础模型和研究系统。
最近:数学系统开始采用分阶段能力评估。
面向科学研究的智能体、文献系统与自动化工作流。
最近:闭环实验成为科学智能体的核心评价对象。
开放生物医学研究与生成式生物模型。
最近:单细胞模型公开跨实验室批次偏差。
PEOPLE · 02
不做名人录,只呈现观点如何随时间变化。
数学研究、形式化证明和 AI 协作边界。
最近:应把“提出问题”与“完成证明”分开评价。
从通用智能路线到 AI 驱动科学发现。
最近:开放推理代码应成为科学模型发布的一部分。
空间智能、具身理解以及视觉系统与真实世界。
最近:智能系统需要形成对三维世界的可操作理解。
SCIENCE DOMAINS · 03
主题只表示科学问题,不再混入公司和内容类型。
证明、形式化、猜想生成与机器辅助探索。
最近:研究过程开始取代单一正确率。
从结构预测到生成式设计,再回到湿实验验证。
最近:可复现性成为模型发布事件的一部分。
现场真值、监测尺度与保护决策中的可靠 AI。
最近:跨站点迁移误差按季节和类群分别报告。
MODELS & SYSTEMS · 04
模型不是榜单条目,而是与论文、代码和验证绑定的研究对象。
面向形式化数学证明与搜索的系统谱系。
最近:评测拆分为猜想、搜索、证明和解释。
从结构建模走向可合成、可验证的功能设计。
最近:权重、推理代码与湿实验结果同步发布。
文献检索、假设生成、实验设计与机器人执行。
最近:从演示完成度转向真实实验增益。
AI FOR SCIENCE DAILY · VOL. 001
从数学证明到自动化实验,今天的共同线索不是模型又变大了,而是研究者开始把“产出看起来合理”拆成更具体、可检查的环节。
更细的评价对象会暴露系统究竟擅长搜索、形式化还是提出问题,也让人类贡献的位置更清楚。
代码、权重与湿实验结果同时出现,使“科学价值”和“证据充分”能被分别阅读。
闭环实验是否带来可验证增益,比 Agent 是否能生成一份研究计划重要得多。
人物 · MATHEMATICS
数学家 · UCLA 教授
追踪他关于数学研究、形式化证明、AI 协作边界和公开数学实践的主要发言与研究节点。
RELATED TIMELINE