Ideogram 4.5 首次进入 Artificial Analysis 图像编辑榜单,编辑榜第 23、文生图榜第 34
Artificial Analysis 评测显示,Ideogram 4.5 在 AA-Image-Editing v2.0 榜单首秀排名第 23,是 Ideogram 首个上榜的模型,在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 上升。
AI News · 资讯流
聚合值得关注的 AI 动态、产品发布、行业变化和社区相关机会。
Artificial Analysis 评测显示,Ideogram 4.5 在 AA-Image-Editing v2.0 榜单首秀排名第 23,是 Ideogram 首个上榜的模型,在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 上升。
Ideogram 4.5 首次进入 Artificial Analysis 的 AA-Image-Editing v2.0 榜单,排名第 23,Text to Image 排名第 34,比 Ideogram 4.0 的第 40 有所上升。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 Agent Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pareto 前沿。
你可能已经注意到,我们 Embed 5 的基准测试看起来有点不一样 👀 Embed 5 是首个采用 RCP-nDCG@10 评测的模型系列,这是我们最新的方法论,改进了对真实场景检索质量的评估。
Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首秀排名 #3,净提升 +12.5%,比 Claude Sonnet 5 (High) 高 8.1 个百分点,并在 Chat 类别以 +15.6% 排名 #1。
Black Forest Labs 发布 FLUX 3 Image,是 FLUX 3 多模态模型中负责图像生成与编辑的部分,可用边界框在 0 到 1000 的画布网格上控制每个元素的位置,也支持直接用提示词生成。
Arena 发布本周榜单更新:GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 第 3 并以 $8/MToken 加入 Pareto 前沿,随后被 Sonnet 5.5 挤至第 4 并跌出前沿。
Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。
Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首段结果仅约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,限期内每小时音频 0.54 美元。
德国 AI 公司 Black Forest Labs 于 10 月 2 日发布图像生成模型 FLUX 3 Image,支持生成最高 4K 分辨率图片。用户可在 0–1000 坐标网格上通过 ID、描述文本和边界框精准排布画面元素,单次生成最多融入 10 张参考图像,并支持像素级精确多轮编辑。该模型目前以付费服务提供,开放模型版本将于数周内公开。
Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。
Black Forest Labs 发布 Flux 3 模型家族的图像模型 Flux 3 Image,宣称支持多步编辑且不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
AWS Strands Labs 开源决策模型 Strands Decider 2B(1.9B 参数),不生成文本,只在选项、yes/no 概率或量表评分中给出带置信度的答案。
小米 MiMo V2.6 Pro 进入 Arena 的 Agent 榜单第 19 名,输出价格为每百万 tokens $0.87,低于排在其前的 18 个模型。其单任务中位成本 $0.10,并列 top 19 中最低,与排第 15 的 DeepSeek V4.1 Flash (Max) 持平。
Cloudflare 于 10 月 1 日发布基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款,分别基于 Qwen3.8-27B 和 Qwen3.5-9B。
可灵AI公众号发布超级创作者、奥美资深创意总监盛健松对 Kling 4.0 内测版的实测。Kling 4.0 已开启内测,将于10月正式发布,支持最长30秒原生视频生成、主体与场景资产调用、声音延续、动作迁移,并提升复杂运镜稳定性、长提示词理解和跨镜头一致性。
Signal65 报告测试显示,高通 18 核骁龙 X2 Elite(X2E-88-100)在 CPU、AI 和多数续航项目中领先英特尔酷睿 Ultra X7 358H。
Cloudflare Workers AI 团队发布首批自训模型 Clef(27B,基于 Qwen3.8-27B)和 Clef-flash(9B,基于 Qwen3.5-9B),二者为决策模型,针对类型化问题返回各选项概率而非自由文本,以 Apache 2.0 开源并兼容 TypeSafe AI 的 Jev System One API。
Artificial Analysis 发布 Coding Agent Index 榜单,Claude Sonnet 5.5 (max) 在 Claude Code 以 68 分居首,但每任务成本最高达 $14.19。
GPT-6 Astra Ultrafast 现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell GPU 上。
Black Forest Labs 宣布发布新图像模型 FLUX 3 Image,主打精确编辑并支持 4K。用户已可在 Tools Playground 试用新功能,开放权重计划在未来几周内放出。
微软于 10 月 1 日发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言和自动语言检测,可在讲话进行时持续输出文字。
Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。
"今天,我们发布两个由 Cloudflare 训练的决策模型,Clef 和 Clef-flash" https://blog.cloudflare.com/clef-decision-models/ 从没见过一个想法传播得如此之快。
Tavus 发布首个 Human Interaction Model(HIM)Griffin,称其为首个通过视频图灵测试的模型。48% 与其实时视频对话的人误以为对方是真人,此前系统通过率低于 3%,并位列 NVIDIA 全双工 AI 视频基准第一。作者 Rohan Paul 转引 Tavus 官方发布并补充演示视频中的表现。
ARC Prize 2026:ARC-AGI-3 里程碑 #2 获奖者 恭喜三位获奖者开源了他们的高分 ARC-AGI-3 解决方案: 1. Daniel Franzen - 27.9%,$25K 2. Lord Han Solo - 23.8%,$7.5K 3. Lohit Siriki - 22.5%,$5K 了解更多关于每个提交方案的信息:
Grok 4.7 已在网页端可用。截图显示 Expert 模式提示“Thinks hard Grok 4.7”,界面还提供 Auto、Fast、Build、Heavy 等模式选项。
一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多运行一小时,每个智能体能获得多少提升!
Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,属于 Human Interaction Model(HIM)。与 Griffin 实时对话的受访者中 48% 认为它是真人,此前系统通过率低于 3%,并在 NVIDIA 的全双工 AI 视频基准上排名第一。fal 转发该发布并祝贺 Tavus 团队。
webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再用程序化验证器做 RL,逻辑分数提升的同时通用推理保持稳定。该模型在 SVAMP 上得 95%、MuSR 上得 64.1%,均为所比较小模型中的最高分。
Grok 4.7 正在 Grok 网页版和移动应用中推出,成为所有模式下的基础模型,包括 Fast、Expert、Build 和 Heavy。作者提到明天的每日 AI 简报预计会因此变得更好。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的 Human Interaction Model,48% 与其实时对话的人以为对方是真人,此前系统通过率低于 3%。作者获早期访问体验,称该视频到视频模型可边看边听、打断和被打断并反应房间内发生的事;在 NVIDIA Video Full-Duplex Benchmark 上生成得分 3.83/5,真人为 3.92。
MICROSOFT 🔥:MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 模型即将登陆 MAI Playground 和 API! > "MAI-Transcribe 和 MAI-Voice 模型:准确、快速、低成本,在音频理解与生成方面名列前茅,助你构建最佳的对话式语音智能体。" MAI Playground 还新增了 "Chatter" 演示语音体验。 测试时间 👀
Tavus 发布 Griffin,称其为首个通过视频图灵测试的人类交互模型(HIM),48% 与之实时对话的人认为它是真人,此前系统通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上得 3.83 分(真人为 3.92),次优系统为 2.80 分;它将听、想、说和面部动画整合在单一系统中,可在对话者仍在说话时读取表情、语气并实时反应。
今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。
Ideogram 发布图像编辑模型 Ideogram 4.5,声称只修改用户指定的局部区域,避免多次编辑后出现瑕疵。模型提供 0.8 到 22 美分每图的四个质量档位,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,开放权重版本即将推出。
Cloudflare 发布两款决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,并以 Apache 2.0 许可证在 Hugging Face 完全开源。
Cohere 发布 Embed 5 嵌入模型家族,分 Pro 和 Fast 两档,均支持文本、图像及图文融合输入、100+ 语言和 128K token 上下文,两档共享同一向量空间,可用 Pro 建索引、Fast 查询。
Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。
AWS 开源高速低成本决策模型 Strands Decider 2B,可在预设选项间排序并输出置信度,完全开源且可本地运行。
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,Mustafa Suleyman 称其为全球最准确的实时转写模型,比 ElevenLabs 快 55%、便宜 60%。引用的 Artificial Analysis 数据显示,该模型以 2.5% WER、语音结束后 0.13 秒出稿在 AA-WER Streaming 38 个模型中排名第一,超过此前第一的 Grok Voice Transcribe 2.0(2.7%、0.49s),流式定价为每小时音频 $0.54,非流式为 $0.10 每小时。
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,在 AA-WER Streaming 评测的 38 个模型中以 2.5% WER、语音结束后 0.13 秒返回最终转写,登顶 Final Transcript 和 First Partial Transcript 准确率。
Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显示字幕出现速度比最接近的竞品快 2 倍,介绍价 $0.54 每小时音频。
✨ Viggle Turbo v0.3 来了! 全新的 9-step 模式带来更干净的画面、更精细的细节,以及更好的小字渲染。 现在在 ComfyUI 中更易使用——提供 LoRA 或单文件 int8/fp8/GGUF 模型。
在我们的探索器中对比各模型的 ECI:https://epoch.ai/eci?view=graph&tab=scatter&eciPreset=software
Epoch AI 发布的 Epoch Capabilities Index(ECI)榜单中,Claude Opus 5.5 以 167 分登顶,略高于 GPT-6 Astra。Claude Sonnet 5.5 大致追平 Claude Fable 5.1(165 分)。
1/ 来自 @theunbiasedco 的 Pareto 26.10 Preview 现已在 OpenRouter 上线,输入 $0.80/M、输出 $3.20/M,而当前 Pareto 为 $2.50/$7.50。 一款面向研究、编程和智能体工作流的多模态复合模型,具备 1M 上下文、文本和图像输入,以及工具调用能力。
开源项目 OpenDLSS 用 Vulkan 重新实现了 NVIDIA DLSS 5 的神经渲染网络,与原版 DLSS-NR build 310.8.0 比特级一致,75 个 block 边界的中间结果逐字节匹配。
Ai2 发布 Olmo-core 3,这是支持大规模混合专家(MoE)训练的开源框架,已验证可扩展至万亿参数级别。在 8 张 NVIDIA B300 GPU 上,47B 参数 MoE 吞吐达 52,000 tokens/秒/GPU,约为旧 FSDP 实现的 2.7 倍;专家池从 8 扩至 128 而训练吞吐下降不足 5%。
NVIDIA 发布 Kumo Tabular 表格基础模型系列,用于分类和回归,以标注行为上下文、单次前向传播预测新行,无需训练、调参或特征工程。
DeepSeek 开源六个 Huawei Ascend 项目,矩阵内核速度达到芯片峰值的 99.8%。
Perplexity Research 与 turbopuffer 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,权重以 MIT 许可托管在 Hugging Face,可自托管部署,尚未上线 Perplexity API。
Artificial Analysis 发布对 GPT-6.1 Sol 的评测,称其推进了 OpenAI 模型的成本效率前沿。max effort 下每 Intelligence Index 任务成本 $0.72,不到 GPT-6 Astra($3.26)的四分之一,比 GPT-6 Sol($1.04)低 31%、比 GPT-5.6 Sol($1.99)低 64%。
据彭博社报道,谷歌开始向小批网络安全合作伙伴逐步推出旗舰模型 Gemini 4 Argon,后续将优先面向付费订阅用户扩大开放。谷歌称该模型在多项基准测试中取得靠前成绩,安全测试成绩超过 OpenAI 的 Astra;但知情人士称其部分代码任务表现不佳、不擅前端设计,谷歌否认这一说法,DeepMind 负责人卡武库奥卢表示对性能感到鼓舞。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,在 Artificial Analysis 智能指数得分 24,报告总参数 35B、激活 3B,价格降至每 1M 输入/输出 token $0.10/$0.40,但因每任务消耗约 88k 输出 token,单任务成本约为 GPT-6 Luna (max) 的 5 倍。
Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。
来自 @GoogleDeepMind 的 Gemini 4 Argon 刚刚在一系列生成任务中与顶级前沿模型正面交锋。 每任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,来看 @petergostev 对 Gemini 4 Argon 对比表现的第一印象。 https://www.youtube.com/watch?v=h5EL5zThKaI