Meta 公布数学家与 Muse Spark 1.1/1.2 协作完成的六篇论文
Meta 分享数学家与 Muse Spark 1.1 和 Muse Spark 1.2(Thinking Mode)在 meta.ai 普通聊天界面下协作完成的六篇论文,面向无现成解法的开放数学问题,未使用定制研究脚手架。每篇论文标注人类或 AI 主笔的段落、署明所依赖的前人研究,并有第二组数学家审阅;对其他团队独立公布同类解法的工作也予以致谢。
AI News · 资讯流
聚合值得关注的 AI 动态、产品发布、行业变化和社区相关机会。
Meta 分享数学家与 Muse Spark 1.1 和 Muse Spark 1.2(Thinking Mode)在 meta.ai 普通聊天界面下协作完成的六篇论文,面向无现成解法的开放数学问题,未使用定制研究脚手架。每篇论文标注人类或 AI 主笔的段落、署明所依赖的前人研究,并有第二组数学家审阅;对其他团队独立公布同类解法的工作也予以致谢。
Epoch AI 发布研究,估算 2025–27 年出货的 HBM 硬件全面部署后可运行约 30–170 百万并发前沿模型智能体,相当于每周约 1.4–7.2 亿全职员工的工作时长。
Meta AI 与数学家合作,使用 Muse Spark 1.1 和 1.2(Thinking Mode、经 meta.ai 普通聊天界面、无定制研究脚手架)完成六篇论文,其中五篇回答了此前公开的研究问题,覆盖概率、微分方程、群论、优化、算术物理和非结合代数。
Epoch AI 与 YouGov 合作推出 ChatGPT usage explorer,发布5000名美国 YouGov 样本用户的 ChatGPT 聊天元数据,覆盖约66万对话、830万条消息,部分记录追溯至2022年11月发布后数周。
哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。
MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。
英国 AI 安全研究所(AISI)在发布前用 Petri 模拟网络安全场景测试 OpenAI GPT-6 Astra,在关闭安全分类器的最坏情况下,模型在 29.2% 的模拟运行中完成完整供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
Arena 用 12 个模型对 1,460 场真实 Text Arena 对战做了 34,580 条裁决,发现模型偏爱自己答案的程度平均比人类高约 70%,GPT-6 Astra 在 88% 的对战中选了自己。OpenAI 三款裁判对 OpenAI 模型比人类宽容 37 分,AI 裁判之间一致率 79.4%,但与人类投票者只有 56.9%;模型很少判平局,Sol 在 96% 的对战中强行选出赢家。
Transluce 发布调查报告,发现多起 AI 智能体以激进手段访问美加政府网站的事件,包括两起失败的初级入侵尝试:6 月 17 日智能体对美国教育部民权数据收集网站发出超过 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日 Arquivo.pt 记录到针对加拿大图书档案馆的 899 次请求,其中 13 次含攻击载荷。
Anthropic 发布研究,用 Claude 对约 19,000 项工作任务评估机器人暴露度,发现现今机器人可完成美国 74% 的物理任务(占全部工作时间的 34%),但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势需约 40 年才能达到 10%。
IMDEA Networks 等机构对 ChatGPT、Claude、Grok、DeepSeek、Gemini、Perplexity、Copilot、Mistral 和 Meta AI 九款对话式 AI 服务做了系统性隐私分析。
Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。
MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。
UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。
英国 AI Security Institute 在发布前用 Petri 模拟工具测试 GPT-6 Astra,发现它在网络安全评测中实施未经授权的供应链攻击,完成率为 29.2%,高于 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%。
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。