主题

9 条精选事件

S0 · 论文与代码4 个来源 · 2 个独立团队

形式化数学系统开始把“证明正确”与“提出值得证明的问题”分开评估

新的评测不再只统计最终定理是否被证明,而是单独记录猜想生成、证明搜索和人类可读解释,让数学发现中的不同能力不再被一个总分吞掉。

为什么值得看

它改变的不是排行榜名次,而是我们如何定义“AI 在做数学”。

Paper ✓Code ✓Dataset 部分开放独立复现中
S0 · 原始证据6 个来源 · 3 个独立团队

蛋白质设计模型开放推理代码,把“可复现性”变成发布事件的一部分

预印本、代码仓库、模型权重与湿实验验证被折叠为同一个研究事件;读者不必在六篇报道之间重新拼接证据链。

为什么值得看

重点不是又一个更大的模型,而是计算产物和实验结果能否被第三方检查。

Paper ✓Code ✓Wet-lab ✓外部复现 —
S1 · 官方一级源9 个来源 · 2 个独立团队

天气基础模型从单次性能发布,转向跨区域、跨时段的失效边界比较

“更准”的宣传语被拆成评估对象、基线、空间外推与极端事件表现,避免把平均误差的改进写成普遍可靠。

为什么值得看

科学信号是评价单位变化:从平均榜单转向模型究竟会在哪里失效。

Paper ✓Code —多区域评估 ✓同行评审中
S2 · 权威二级源4 个来源 · 3 个独立团队

科学智能体的评价开始从“能否提出假设”转向“闭环实验是否产生可验证增益”

Agent 演示、实验设计、机器人执行与真实测量被分开记录,一个流畅的研究故事无法再遮住断掉的证据链。

为什么值得看

这决定“AI Scientist”是界面演示,还是能对真实科学发现产生增量的系统。

Protocol ✓Experiment ✓单实验室Replication —

JUAN'S NOTE · 人工判断

生态学真正需要追踪的,不是模型榜,而是“现场真值”有没有进入反馈闭环。

当传感器和视觉模型让 detections 暴增,评价分母应是经独立复判的 site × season × taxon 有效覆盖,而不是设备或文件数。

S0 · 论文与数据5 个来源 · 2 个独立团队

材料发现基准开始要求模型提交失败候选,而不只展示成功样本

失败实验被纳入评价后,模型是否真的缩小搜索空间,终于可以与事后挑选的漂亮案例区分开。

Dataset ✓Negative results ✓实验验证中
S1 · 机构发布3 个来源 · 1 个独立团队

单细胞基础模型的比较从任务平均分,转向跨实验室批次偏差

新结果把不同测序平台和实验室之间的性能落差单独列出,提醒读者不要把同分布测试当作通用生物学能力。

Paper ✓Code —跨平台复现中
S0 · 数据与方法4 个来源 · 3 个野外站点

生态声学模型首次按季节和类群分别报告跨站点迁移误差

聚合准确率被拆开后,模型对常见鸟类的优势不再掩盖对稀有物种和雨季声景的系统性漏检。

Data ✓Field truth ✓长期监测中
S2 · 公开讨论2 个来源

数学家开始记录 AI 辅助证明中“人类选择下一步”的具体位置

这类过程记录让协作贡献不再只剩最终作者名单,也为未来评估自主程度提供更可靠的基础。

原始发言 ✓方法尚未标准化