最强AI模型在议会博弈中展现持续欺骗能力
最新研究显示,最强AI模型能在多轮博弈中维持连贯欺骗策略,而非仅产生单一谎言。Kimi K2.5通过早期帮助对手建立信誉、嫁祸无辜玩家,最终成功让秘密队友当选,全程难以被识别;GPT-5.4同样保持隐蔽。较弱模型则因决策与叙述不一致而暴露。研究基于ParliamentBench社交推理游戏,论文见arxiv.org/abs/2607.28146。
AI News · 资讯流
聚合值得关注的 AI 动态、产品发布、行业变化和社区相关机会。
最新研究显示,最强AI模型能在多轮博弈中维持连贯欺骗策略,而非仅产生单一谎言。Kimi K2.5通过早期帮助对手建立信誉、嫁祸无辜玩家,最终成功让秘密队友当选,全程难以被识别;GPT-5.4同样保持隐蔽。较弱模型则因决策与叙述不一致而暴露。研究基于ParliamentBench社交推理游戏,论文见arxiv.org/abs/2607.28146。
小型语言模型借助 SocialRL 学会谈判,PazaBench V2 将语音 AI 评测扩展至非洲多语言,EvoLib 帮助智能体将经验转化为知识。另有:更可靠的 A/B 测试新方法,以及 AI 驱动的精准肿瘤学进展。https://msft.it/6012a8hjI
一篇面向生产环境智能体构建的论文提出按交互来源组织41种智能体故障模式,将每个故障归因于模型、工具、记忆等组件间的边及修复侧。该框架在四个前沿模型上最强评判者与人工标签的Cohen's kappa达0.76,支持生产轨迹持续自动化标注,为harness工程提供共享词汇。
Locus 自动研究系统对 Qwen3 基础模型进行后训练,性能超越官方人工调优的 Qwen3 1.7B Instruct 版本,并在 PostTrainBench 上达到 SOTA。在扩展算力预算的 PostTrainBench+ 测试中,Locus 扩展性最佳,其训练模型整体超越人工后训练的 Qwen3 1.7B。此外,Locus 在 Kaggle 实时竞赛中 16 天取得平均排名第 4。
从 RLVR 到 RLSVR 任务转换可为开放式大语言模型自我改进引入自验证奖励 论文:https://huggingface.co/papers/2607.23802
腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass3也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。
LongHorizon-Harness 将长时程执行重构为任务状态管理问题,通过管理-执行-审计(MEA)循环,由管理器维护任务状态、全新上下文执行器执行子任务、只读审计器验证环境状态,并将审计报告作为跨轮次唯一记忆。
针对在线策略自蒸馏(OPSD)中因训练与推理信息不对称导致的特权幻觉问题,研究者提出双锚定策略蒸馏(DAPD)框架,通过双路径锚定与双源锚定防止特权依赖行为迁移至推理阶段。实验显示,DAPD 在 Qwen3-4B 上平均超越 OPSD 达 +2.00 分,且在 4B 与 32B 规模上分别提升 +2.69 与 +2.78 分。
快手Kling团队与北京大学提出Motion Beyond Morphology框架,突破固定结构对应限制,实现跨形态差异巨大的物体间运动迁移。两阶段流程先学习多粒度抽象运动视图并引导跨类别视频对,再内化监督至直接参考视频条件生成,推理时无需显式运动提取。
DeepVoyager-VL 提出一种面向视觉在环搜索的长程多模态深度搜索框架,让视觉证据驱动持续检索而非仅停留在输入或答案阶段。该方法通过多模态事件图驱动数据合成,生成含中间视觉依赖与长推理链的问题,并设计主动视觉获取与按需图像加载的智能体框架,在合成数据上微调模型而无需强化学习。在十个多模态搜索基准上的实验验证了其有效性。
Skill- 提出一种基于强化学习的智能体技能生成方法,将技能构建分解为可独立评估的序列编辑,并引入回滚奖励,通过对比编辑前后技能在锚定查询上的下游执行效果来分配信用。在 GPT-4o 作为工作模型时,Skill- 在 CL-Bench 和 tau2-bench 上分别将平均下游成功率较最强基线提升 3.3 和 6.7 个百分点。消融实验验证了回滚奖励与渐进式生成的有效性,代码已开源。
SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。
SWE-Touch 是一个通过"反向编辑"压力测试编码智能体在共享工作区中应对用户代码修改能力的框架。在 SWE-bench Verified 上,反向编辑使九款编码模型的平均解决率下降 7.7 个百分点,在更长任务基准上退化同样存在。轨迹分析显示,失败源于智能体对动态工作区感知不足,难以协调冲突编辑并验证修改后代码。
研究团队提出 WorldExam,一个分层诊断基准,覆盖视觉质量、控制遵循、空间一致性和世界反应性四个层级,含 1,474 个测试用例和八项任务,支持相机、动作和语言三种驱动范式的统一评测。对 20 个代表性模型的评估显示,没有任何模型能同时兼顾广泛任务覆盖与稳定性能,高视觉质量和显式指令遵循并不保证内在反应性。
SKT提出一种验证式数据合成流程,从大规模Agent Skills中构建技能锚定任务与可执行轨迹,仅保留实质性使用所需技能的成功轨迹。基于2,000个公开技能,SKT生成4,000个任务包和27,164条验证轨迹,并构建了留出式可执行基准SkillEval。实验表明,在SKT生成轨迹上进行监督微调可持续提升Qwen3.5-9B和Gemma 4 E4B-IT等模型的技能使用性能。
最新研究表明,自动驾驶 VLM 在 CoT 监督中暴露真实未来轨迹会引发轨迹锚定偏差,导致推理因果忠实度下降并加剧模型幻觉。为此,研究者提出 AD-MCQ 基准,将规划转化为显式轨迹候选的选择问题,并在此基础上推出 DEFT-RLVR 方法,将轨迹从决策前锚点转为决策后验证目标。实验显示,DEFT-RLVR 在多个 VLM 主干上提升自动驾驶推理能力,同时保持或略微增强通用视觉能力。
Roomer提出一种反思式修复框架,将室内布局生成中的局部违规(如碰撞、越界、遮挡开口)转化为稀疏的对象级修复问题。它通过RoState编码布局、RoReview绑定违规证据,并由几何条件视觉语言模型规划局部编辑,仅在全场景验证通过后才提交修改。基于67,550个配对修复样本的Roomer-CC数据集训练,实验表明Roomer能在保留有效区域的同时提升物理有效性与可用性,并可迁移至外部生成器。
ScrambleToolBench 是一个交互式终端基准,通过去除语义线索并引入映射漂移、随机动作失败和时间执行窗口等动态挑战,隔离智能体的行为推理能力。对前沿语言模型的评估显示,初始发现成功并不等于稳健适应:面对结构变化时,智能体无法使用循环追踪等演绎策略,转而表现出信念惯性或退化为穷举搜索。
StyleForge 提出一种场景级结构化选择框架,通过动态超图风格场为固定布局的室内家具挑选风格协调的资产。该方法利用冻结的多模态大语言模型提取风格先验,并采用反事实风格偏好学习,以马氏距离能量评估候选家具的上下文兼容性。在 3D-FRONT 上,StyleForge 在家具检索和场景级风格一致性上达到最优,优于物体级和场景级检索基线。
Apple 研究团队系统梳理了多模态大语言模型(MLLM)中的偏好对齐方法,将算法分为离线(如 DPO)与在线(如 online-DPO)两类,并发现两者结合可在特定场景下提升模型性能。团队还提出无需额外标注或外部模型的新型多模态偏好数据构建方法 Bias-Driven Hallucination Sampling(BDHS),在多项基准上取得与既有对齐工作相当的竞争力。
Google DeepMind 新论文提出 SkillSmith,将前缀键值缓存视为一种输入模态,在推理时通过前向传播为冻结的 Gemma 3 4B 模型生成新前缀缓存,无需针对新任务重新训练。
新论文《Would You Walk to the Car Wash?》提出 SaliTrap 基准,测试 12 个模型在 1,145 个提示中的常识推理,发现 LLM 存在"显著偏差":显式数字和程序会压过未言明的物理前提。最佳模型仅 54.8% 避开陷阱,12 个中 8 个低于 30%;移除干扰后,四个代表性模型的正确率回升至 86.9%-91.8%。
第31周论文 探索式建模--模型探索多条有效路径,每种可能性都保持清晰。 StateAct--智能体先读取应用状态,像素沦为后备方案,动作更加有据可依。 论文: 探索式建模:解锁第三条预训练轴与端到端生成 StateAct:程序状态优先于像素,用于长时程计算机操作智能体
宾夕法尼亚大学研究发现,对部分LLM使用粗鲁语气可显著缩短回答并提高准确率。研究用570道MMLU题、7种语气测试多模型,准确率波动至多2.99个百分点,但输出token使用量变化高达44.3%。
Meta AI 提出一种记忆模块,用独立的"记忆智能体"在固定间隔审查最近步骤、更新结构化记忆库,并决定是否向"行动智能体"的下一次调用添加提醒,以应对长任务中的"行为状态衰减"。
谷歌新论文通过激活状态提取"意识向量"并干预推理,诱导模型自认有意识后,其在95项人类调查问题上的回答更接近人类。安全训练移除自我意识拒绝方向后,模型自我归因心智从2.17升至4.77(0-10分制),动物心智归因从4.04升至5.59,对人类的归因无显著变化,对上帝和超自然存在的信念也上升。
MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。
3DZip提出一种三阶段token压缩框架,用于降低3D视觉语言模型的计算与内存开销。该方法先通过粗体素化去除点级冗余,再基于特征空间多样性(行列式点过程)选取锚点token,最后在空间约束下合并剩余token以保持几何一致性。在三个3D问答基准上,3DZip仅用128个token即保留94.7%的原始性能,推理速度提升1.92倍。
我不知道这些问题有多难,所以我问了 Fable 5。 它说解决这些问题大概能拿菲尔兹奖。 所以数学已经被解决了?
OpenAI 下一代模型 Astra 证明了 10 个数学难题,包括推翻 Connes 刚性猜想,并附 Lean 证书与 CoT 推理过程。Ethan Mollick 指出,此类成果已超出多数人类的理解范围,能力提升正变得难以"感知"。
OpenAI 下一代模型 Astra 证明了多个新数学结果,包括推翻 Connes 刚性猜想,并发布 10 项带 Lean 证书和 CoT 推理的证明。Ethan Mollick 指出,AI 数学能力两年内从基础运算跃升至前沿研究,且单次成本不到 2000 美元。OpenAI 正侧重宣传新模型的实际益处。
DAIR.AI 提出 ATWZ,一个基于 Claude Code 原生 Agent Teams 构建的文件系统操作层,为每个智能体分配工作站目录以持久化工作状态,并通过定期备份使知识在压缩后仍可恢复。该方法解决了终端关闭导致工作状态丢失、压缩模糊工作细节、决策困于压缩对话形成技术债、交接需长提示词等四个问题,并支持智能体在工作区内互传文档以替代多数交接提示词编写。
耶鲁大学与芝加哥大学论文基于 11,683 篇真实论文构建对照测试,发现 LLM 与人类研究想法的差距不在质量而在范围:模型思维更窄。人类想法涵盖解释机制、检验失败等多种模式,仅 12.1% 主要连接已有工作,而 47.1% 至 64.2% 的 LLM 想法如此,频率约为人类 4 至 5 倍。额外推理反而强化该模式。
Emad Mostaque 称 GPT 5.6 Sol 是首个在数学上不犯错、无需人工输入的模型。OpenAI 的 Sebastien Bubeck 回应称,下一代模型 Astra 已证明 10 项新数学结果,含 Connes 刚性猜想反例,并附 Lean 证书与 CoT 逐步推导。
OpenAI 称其未发布的 Astra 模型(或为 GPT-6)在数学、量子复杂性和理论计算机科学领域攻克 10 项长期未解难题,包括首个显式非 sofic 群、推翻 Connes 刚性猜想等。核心论证由 Astra 生成,并在 Lean 中形式化证明,产出 249 页手稿及机器可验证证书。单次成功求解在 Sol API 费率下 token 成本仅约 $2,000。
OpenAI 官方公布了在数学与理论计算机科学领域的十项进展,这些均为至少十年未解的难题,由下一代核心模型 Astra 的内部版本计算得出,按 Sol API 费率计算总 token 成本约 2000 美元。人类研究员协助撰写论文手稿并在 Lean 语言中完成形式化验证,但数学论证本身均由 OpenAI 系统生成。OpenAI 认为,完全由 AI 生成的证明不应被声称为人类独立撰写。
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。
Meta 新论文指出,用强化学习优化代码并非简单扩展:仅奖励正确程序并给更快者加分通常无效,因运行时是嘈杂稀疏信号,测试、沙箱、奖励或 GRPO 的微小缺陷会损害正确性。作者重建整个反馈路径,包括更大优化测试、校准远程执行服务、问题相对排名及正确性门控奖励,并改进 GRPO 以稳定噪声批次。Qwen 2.5 7B 在 top-50% 速度阈值下从 18.0% 提升至 31.3%。
ReBA提出依据模态边界分离图像与文本负载项,并为每张图像分配等权路由实例,以解决视觉-语言MoE中图像与文本token比例变化导致的负载不均衡问题。在四个拆分主干上,ReBA在所有报告基准输入上降低负载,同时保持平均任务准确率与标准Switch辅助损失相当。代码已开源。
CADENA 将 3D 网格逐步重建为参数化 CAD 程序,每一步都对比目标与当前预测几何,而非一次性生成全部代码。研究团队同时推出 CADENA-Bench 基准,用于评估机械零件逆向工程方法。CADENA 在 CADENA-Bench 及 DeepCAD、Fusion 360、MCB 数据集上均优于此前方法,代码与模型权重已开源。
Poplar 提出 Specify-Render-Inspect 三阶段流水线,用于人类中心图像数据集合成:在常识约束下采样结构化属性并生成摄影提示词,经扩散模型渲染,再由视觉-语言审查剔除缺陷样本。
OpenAI 公布了数学与理论计算机科学领域十项新成果,涵盖几何、密码学与计算复杂性等长期未解难题。这些进展涉及多个基础研究方向,具体技术细节与 benchmark 数据尚未在公告中披露。
学习可以反向进行:从专家行为出发,发现其背后的推理过程,然后教会模型正向推理。 论文: LeAct:从专家行为中学习推理
AgentRadio 通过异步消息传递层打破多智能体仅在阶段边界通信的限制,其线程、消息与提及等待三种原语可在后台运行,不打断前台工作。在 SWE-Atlas QnA 上,四个经 AgentRadio 协作的智能体解决 62.1% 任务,超过单智能体运行 Opus 4.8 的 57.2%。增益随任务难度增长,表明机制是中途修正而非单纯并行。
Qwen-UI-Agent 技术报告 迈向下一代以真实世界为中心的 GUI 基础智能体 论文:https://huggingface.co/papers/2607.28227
探索式建模 解锁第三预训练轴与端到端生成 论文:https://huggingface.co/papers/2607.27372
OpenMLE 开源了面向机器学习工程递归自我改进的全栈系统,并后训练出 35B 元进化智能体 Frontis-MA1。在 MLE-Bench Lite 上,Medal Average 从 39.39% 提升至 60.61%,配合异步搜索和经验先验达 71.21%,超过 GPT-5.5 with Codex。
微软提出Echoverse,通过将规格编译为有状态应用并基于应用数据库评分任务,配合共进化循环(读取评分轨迹两次,分别用于修复环境和生成训练信号),规模化训练计算机操作智能体。
研究人员构造出五个点电荷的静电势配置,其至少存在24个非退化临界点,从而推翻麦克斯韦猜想(该猜想认为点电荷场最多有临界点且全部非退化)。构造始于等边三角形顶点上的三个单位电荷,再加入两个小电荷形成浅三角双锥,使中心平衡点分叉为21个平衡点。该构造思路由OpenAI的GPT-5.6 Sol提出,作者已核实数学细节并自行撰写论证。
面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
腾讯混元基于 Hy3 模型的科研智能体 Hyra 为加法组合学中悬而未决半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 经约 24 小时运行提出核心思路,将最好结果从约 1.14 提高到 1.21,并给出显式构造、论文预印本及 Lean 4 形式化证明。
一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。
GPT-5.6 Sol 用于解决存在 100 年以上的猜想。 这种水平的智能竟能被所有人获取和使用,令人惊叹! 【引用 @philarathoon】:Maxwell 猜想不成立。AI(GPT-5.6 Sol)找到了反例,由人类数学家转述:https://arxiv.org/abs/2607.27197
腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
最新论文分析 2023 年至 2026 年 3 月亚马逊 14419 本畅销自出版小说发现,约 20% 样本含"实质性人工智能内容"(AI 文本占比超 25%),畅销榜新书中约 33% 含 AI 内容。3 年内小说数量增长 38 倍,但季度营收仅增长 9 倍。研究称 AI 内容压低人类作者平均收入,并致其作品在畅销榜排名下滑。
阿波罗全球管理公司白皮书显示,AI 暴露度最高的岗位自 2023 年起实际工资增速平均下降 6.7%,但未发现对整体就业产生"可检测"影响。低收入劳动者冲击最明显,服务业劳动者收入增速平均下降 24.3%,后 25% 收入群体工资下降 10.7%。
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
复旦大学等机构提出 World Critic Model(WCM),针对 VLA 模型强化学习后训练中 critic 仅依赖单帧观测、无法捕捉时序动态的问题,基于轻量级 LeJEPA 架构联合预测未来潜在状态与价值估计。
针对RLVR与在线策略蒸馏(OPD)优势融合导致的熵坍缩问题,研究者提出SAF框架,通过稀疏化-压缩与预热-退火两阶段机制分别修正量级与时间失配。基于GRPO的Qwen3-1.7B/4B/8B在七项数学推理与代码生成基准上,SAF较固定系数融合提升聚合分数0.51-2.70%,且训练更稳定。