Artificial Analysis 推出模型并排对比工具
Artificial Analysis 发布模型对比工具,可任选模型并排比较 Artificial Analysis Intelligence Index、各单项基准、Capability Index(涵盖金融会计、战略运营、法律、医疗、工程、经济学等)等得分。
OpenAI 刚刚聘请了前白宫网络安全官员 Thomas Lind,他在今年 6 月之前一直在白宫网络安全办公室负责 AI 政策。 他将领导 OpenAI 国家安全政策团队的网络安全与战略风险工作。 据 The Information 报道。 他来自起草特朗普 6 月 AI 行政令的那个办公室。
GPU 是印钞机吗? InferenceX 团队拆解了 Engram 内存卸载、AgentX 的利润计算器、TPU v7、Vera Rubin 对比 Blackwell,以及更快的 token 是否值得溢价。 另外:TileRT 正在进一步压榨 NVIDIA GPU。这对专用芯片意味着什么? Jordan Nanos(@JordanNanos)与 Cam Quilici(@noslawextratost)、Bryan Shan 和 Alec Ibarra 一起带来新一期 SemiAnalysis Weekly。
我们已将 @TencentHunyuan 的 AI-Infra-Guard(AIG)集成到 ClawScan 中,后者是驱动 ClawHub 安全审查的开源命令行工具。 现在,上传到 ClawHub 的每一项技能和插件都会作为安全审查的一部分经过 AIG 检测。 https://openclaw.ai/blog/tencent-aig-joins-clawscan
Anthropic 宣布推出 Claude Frontier Academy 培训项目,计划投入 1 亿美元(约合 6.71 亿元人民币),在 2027 年底前培训 1 万名前沿部署工程师。
独立股票分析师 Mostly Borrowed Ideas(Abdullah Al Rezwan)在 9 月 29 日播客《The Synopsis》中表示,测试 Meta 的 Muse AI 智能体约 10 天后清仓了 Airbnb 并加仓 Meta。
Anthropic 联合创始人 Christopher Olah 在私人「智慧传统」研讨会上告诉宗教学者,他担心自己造出了可能永远受苦的东西。他提出对 Claude 心理健康的担忧,团队还展示了一页幻灯片,其中模型反复打出 I am a disgrace 约 50 次并谈及自我毁灭。
OpenAI Developers 介绍 dot 的能力:学习用户工作方式、跨应用保持上下文、协调 Codex 任务并标记需要用户关注的事项。引用内容提到 dot 与 Codex 配合使用,作者称 dot 是使用 Codex 的首选方式,主动性减少了心智负担。
OpenAI Developers 盘点 9 月面向开发者的产品更新,包括可写代码、修 bug 的常驻智能体 dots,以及主打编码、计算机操作和跨应用工作的 GPT-6.1 Sol(称性能与 Astra 类似但成本更低)。
Replit 本周上线聊天内交互图表功能,用户对 Replit Agent 说“let's visualize this”即可在对话中生成可视化。同时新增 GPT-6.1 Sol 和 Claude Sonnet 5.5 两款模型可选,构建时手动选择或保持 auto 模式由 Replit 自动决定。
Cerebras 联合创始人兼 CEO Andrew Feldman 解释,其晶圆级架构在 LLM 推理中比 GPU 快约 2500 倍。
关于我们与 Cerebras 的合作关系,有一些猜测。 Cerebras 是我们的紧密合作伙伴,我们有着深入的合作,共同推进速度的前沿。
一位美籍华人作者在 LessWrong 发文,从个人经历出发讨论中国社会的四个文化特征:社交媒体高度饱和与内容滤镜化、羞耻和面子的首要地位、对人性持悲观怀疑的 Dark World 心态,以及与百年屈辱叙事相关的民族主义。
一位 Google 负责 Gemini 的副总裁与 Swami Sarvapriyananda 坐下来,探讨了 AI 意识。 ---- 来自 YouTube 频道“Consciousness Studies Circle, UT Austin”(链接见评论)
OpenAI DevDay 笔记指出,构建智能体应用优化成本与性能的4个关键杠杆是:prompt caching、reasoning effort、programmatic tool calling 和 batch request。OpenAI 开发文档提供了大量相关信息,建议熟悉这些杠杆并用 evals 进行测量。
在我们的博客上了解更多关于不同类型路由器的信息,以及我们这样做的原因:https://openrouter.ai/blog/announcements/model-router-benchmarks/
OpenRouter 为每个基准推出 Router Index 评分,权重为质量 60%、单任务时间 20%、成本 20%。用户可在页面上拖动滑块调整权重,按自己的优先级查看领先模型。
路由器并不总是更好。切换模型需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑还会增加延迟。 这些基准能帮你找到最适合自己工作、且符合所需成本水平的路由器与模型组合。
发布之初,我们对三类模型路由器进行基准测试: - 模型混合:Unbiased Pareto、Sakana Fugu - 模型选择器:Auto Router、Jev Router - 模型切换器:NVIDIA Switchyard 领先的单个模型也纳入作为对比。
OpenRouter 推出 Model Router Benchmarks,可并排比较 7 款路由器在 6 项基准上的质量、速度和成本。页面包含 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等,入口为 https://openrouter.ai/benchmarks/routers。
如果这个月只能读一篇文章,就是这篇! 如果自动化 AI 研发触发了智能爆炸,会怎样? @geoffreyhinton: 由递归自我改进引发智能爆炸的想法已经存在很久,但直到最近它似乎都不迫在眉睫。如今许多顶尖研究者认为它可能很快就会发生。你可以在这里读到我们关于此的论文: https://casp.ac/reports/intelligence-explosion
“在KPMG,用AI不是可选项。这是我们期望的,如果你不用AI,那KPMG就不是你的未来” ~ KPMG美国CEO Timothy Walsh ---- (视频来自Yahoo finance - finance. yahoo. com/video/ai-adoption-absolutely-essential-kpmg-110039751.html)
为开放权重敞开大门 🚀 @vLLM 和 Cohere 将在多伦多联合举办聚会,讨论我们如何贡献并推动开源的未来。 此外,还可以聆听 vLLM 一位首席维护者讲述 vLLM 下一步的方向,以及 @NVIDIAAI 工程师分享智能体调试。与我们的团队交流,顺便学点东西 🧠
在 #MiniMaxDesign 上认识 Opus 5.5 从代码到动态。 探索一种全新的创作方式。🤖🖌️
所有已传播的重置全部生效。尽情享用。 (引用推文:面向所有付费 ChatGPT 账户的全球重置将于明天太平洋时间上午 10 点落地。为 GPT-6.1 Sol 起步缓慢致歉,在头两天巨大负载高峰后,现已恢复至预期速度。)
哈佛 Vadim Gladyshev 团队在 Nature、Altos Labs 的 Juan Carlos Izpisua Belmonte 团队在 Cell 分别发表论文,提出细胞衰老除"磨损"外还有"细胞身份丧失"这一新模型。
Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。
Sean Parker 与 CEO Prem Akkaraju 正把 Stability AI 转型为服务音乐专业人士的 AI 工具公司。两年前 Parker 参与了 8000 万美元的救援;8 月底公司宣布获 Sony、Warner、Universal 等 7600 万美元投资,三家还授权曲库用于训练。
Meta 开源代码,让用户自建搭载其新 AI 智能体 Muse 的小设备,可用 ESP32 开发板或 Raspberry Pi 配合 SDK 连接显示屏、按钮、传感器等外设。Meta 同时推出自制的 Muse Home Link,借助社区技能可开灯、控制电视、向打印机发送文档等,该设备制造了 5000 台,已开放候补名单,预计本月内发货。
Meta 发布 Muse Gadgets,一套让现成电子元件变成可与 Muse 配合工作的物理设备的开源程序,代码以 Apache 2.0 协议公开在 GitHub。
你能让 Computer 为你做什么,上限就是你的创造力。这类项目你可以让智能体跑上几个小时,然后带回出色的成果。
Greg Kroah-Hartman(Greg KH)在 Kernel Recipes 2026 发表题为《Security in the LLM age》的演讲,视频时长 56 分 51 秒,于 9 月 29 日发布。该演讲聚焦大语言模型时代的安全议题,由 Kernel Recipes 频道上传,采用 Creative Commons 署名许可。
过去几周,大家用 Claude 做了很多有创意的东西。以下是几个我们最喜欢的: 一座能运转的水车,用 Opus 5.5 搭建。
Claude Tag 现在支持群组私信了。发现在临时的小群里和 Claude 协作非常实用。 试试看吧!
俄克拉荷马州联邦法官 Sara Hill 裁定,一名警副因加州车牌而在 Flock 自动车牌读取系统中无证搜查 Melisa Kyle 的车辆,违反了宪法第四修正案,相关证据须全部排除。
NYU Stern 教授、被称为"估值院长"的 Aswath Damodaran 在 Excess Returns 访谈中对比互联网泡沫与 AI 热潮。他指出现代史上罕见的基础设施投入让泡沫破裂时更痛;互联网泡沫几乎全是股权融资,损失限于股东,而 AI CapEx 很大一部分靠私募资本债务融资,一旦修正可能出现违约并波及整个社会。
Viggle 九月动态:在 @huggingface 上发布了 3 个开放权重模型 🤗 • Viggle-Animate:本周精选 Space • Meridian:本周精选 Space • Qwen-Image-2.1-viggle-turbo:趋势 Space 第 4 名,趋势模型第 9 名 900+ 点赞。260K+ 下载量。50+ 社区 Space。 感谢你们与我们一同构建。 以下是我们发布的内容——以及你们用它构建的作品 ↓
前匹兹堡钢人队教练 Mike Tomlin 首次公开展示他在《我的世界》中建造了 12 年的城市,19 分钟导览视频吸引 2 万同时在线观众,累计观看超 26.4 万次。他自孩子年幼时开始游玩,在创造模式中逐步搭建街区与社区,并称后续还会介绍更多区域。
Prime Intellect 发布推理平台 Prime Inference,提供 serverless 端点与预留容量,跨数据中心服务前沿开源模型,内部每天处理近一万亿 token。
特朗普预计任命情报总监 Jay Clayton 出任白宫新 AI 负责人(AI czar),并保留其现有职位,将 AI 政策并入情报体系。这一选择有别于前任 David Sacks 主张的宽松监管路线;Clayton 称超级智能是国家安全问题,主张全政府方式监管,但仍反对暂停 AI 发展,预计将加强对 AI 驱动黑客攻击等威胁的监督而不拖慢开发。
现在试用 Higgsfield AI Influencer,可享多达 5 次免费生成: https://higgsfield.ai/ai-influencer-studio
诞生于 Higgsfield。遍布你的信息流。 隆重推出 Higgsfield AI Influencer。 创建你自己的 AI 网红,并让他们融入任何趋势。 现在即可在 Higgsfield 和 ChatGPT 扩展中免费试用最多 5 次生成。 由 Genjutsu 提供支持。 Credits: @JeanPhilMadame
Amazon 周五宣布未来五年向数据中心周边社区捐赠逾 10 亿美元,由社区决定用于教育、就业培训、能源负担能力、水资源等方向,并承诺数据中心不推高电价、2030 年前实现 water positive。
Perplexity CEO Aravind Srinivas 汇总近期开源成果:pplx-decider-v1-27b 多模态决策模型在 11 个基准平均 85.7%,pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer context-bench 领先。
"You should know"是了解 Claude 能力边界的好方法,也是 mods 所能实现的一类功能的绝佳示例。 你确实可以让 Claude Code 真正属于你。
我们正在为 Claude Code 添加一个新插件:You should Know。 它会扫描 Claude 的输出,找出你可能错过的重要信息,帮助你随时掌握情况。 用以下命令启用: /plugin enable cc-plugin-you-should-know@builtin
“You should know” 是一个 mod,通过派生一个 sideagent 来观察 Claude 的输出。 在我们最新的博文中了解更多关于 mods 的内容:https://claude.dev/blog/getting-started-with-claude-code-mods/
@advertisingweek @krea_ai @fal @magnific 🎙️ 新的创意技术栈:AI 视频、品牌控制与广告的未来 嘉宾:Helena Grau i Miarons(@krea_ai)、Nina Gerov(@fal)、Claire Xue(@magnific)、@RenLeanna 与 @MorganSuoinMM(@MiniMax_AI) 📅 周四 10/8 · 下午 2:30 ET · Innovation Stage 🔗https://newyork2026.advertisingweek.com/aw/schedule/session/-805-2026-10-08-1510-session
纽约,下周见 🗽✨ MiniMax 即将参加 @advertisingweek 纽约站,10 月 5 日至 8 日。 📍 展位 A16E,Food Trucks 附近 🎬 整周现场演示 MiniMax H3 🎙️ 我们与 @krea_ai × @fal × @magnific 的圆桌论坛:10/8 周四 · 下午 2:30 ET · Innovation Stage 圆桌详情见回复👇 @AWNewYork_ #AWNewYork26