Flash模型又添一员大将:实测MiniMax M3.1
Flash模型又添一员大将:实测MiniMax M3.1MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
搜索
MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
DeepSeek开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang编译工具及DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect等计算与通信库,华为亦在CANN社区开源双方围绕昇腾950及超节点的联合创新实践。
Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
至知创新研究院开源320B大模型IQuest-Q1,该模型在代码生成、安全漏洞挖掘等评测中表现优异,并能自主排查训练Bug,在交通调度、仓库管理、电梯调度等真实场景中展现出强大的任务解决能力。
海马云旗下RunningHub发布自研生成式视频超分模型RH Upscale,在13组横向评测中以综合得分0.539位列第一,通过内容保真约束下的时空联合重建与五档模式设计,解决视频超分中"放大而不改内容"的难题。
腾讯正在秘密研发Personal Agent产品"Handy Bot",并计划推出独立App,目前已在微信端低调上线服务号,产品处于内部测试阶段。
Meta发布的个人AI助手应用Muse凭借云端虚拟机执行任务的能力,上线10天登顶美国App Store免费总榜,推动Meta股价单日大涨11.43%,同时引爆Personal Agent赛道,引来OpenAI、Manus及字节跳动等公司纷纷跟进布局。
齐俊元创立的 Today AI 国内版正式上线,定位为「懂你所想,为你先行的个人 AI 助理」,以单一长对话和主动建议卡片替代空白输入框,并已接入邮箱、飞书、钉钉、腾讯文档等国内应用。
Nuanced创始人Ayman Nadeem发文宣布「Plan Mode已死」,指出随着AI模型能力提升,传统计划模式在AI编程中已不再必要,而规划与执行的边界正在逐渐融合。
中国电信研究院与MemTensor等机构提出首个面向智能体记忆系统的操作级幻觉评测基准HaluMem,已被EMNLP 2026主会接收,该基准分别对记忆提取、更新和问答三个环节进行检查,并对Mem0、MemOS等六套系统实测,发现高召回率可能伴随虚假信息写入、低更新幻觉率背后存在大量遗漏、上游记忆问题最终会影响回答等核心现象。