Flash模型又添一员大将:实测MiniMax M3.1

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Flash模型又添一员大将:实测MiniMax M3.1
7398点击    2026-09-30 15:44

上周,OpenRouter 又来了一只飞快的兔子。


一个叫 Space Bunny Alpha 的匿名模型悄悄上线,1M 上下文,能看图、能看视频,思考强度五档可调,免费。


免费、1M 上下文,开发者当然不会放过。


Flash模型又添一员大将:实测MiniMax M3.1


没几天,就蝉联OpenCode榜首第一名。


社区开始给它做指纹测试,一组 24 项的对比,全部对上了 MiniMax 家族的特征。


9月27日,MiniMax Code正式上线 M3.1-Flash-Preview,同样的 1M 上下文,同样原生支持文字、图片、视频输入,思考强度也同样五档可调。


Flash模型又添一员大将:实测MiniMax M3.1


官方没有公布跑分,目前只能在MiniMax Code和Token Plan里用。模型定位是:


Flash级别,速度快,干活靠谱,主力场景是Coding。


这两个月,Flash这条赛道格外挤。DeepSeek V4.1 Flash占着位置,我们前阵子刚测过的 GLM-5.3-Flash(牛来)又把价格打到了地板。


既然没有跑分可看,我们就直接上实测。我在MiniMax Code里开了几个任务,全部拉到max档。


◈一、Coding:接手一个真实的线上项目


第一个是我自己的一个小项目,给服装店用的 AI 试衣间。


顾客上传全身照,挑一件衣服,一键看上身效果,项目已经上线,问题是衣柜太空了。


打开首页,一共就4件衣服。


Flash模型又添一员大将:实测MiniMax M3.1


好在我手里还有一个NAS相册,存了这些天保存的衣服图片。不过,里面混着聊天截图、文档各种杂七杂八的东西。


Flash模型又添一员大将:实测MiniMax M3.1


4000多张图片,首先需要把服装照片筛选出来,但是这个工作量可就大了去了。


我一想,这个筛选工作完全可以交给Flash级别的模型来做。


于是,我要求:


接手服务器上的 tryon-shop,从相册里筛出至少100件不同的衣服,去重、建档、上架,让首页从「四件样衣」变成一个真正能逛的衣橱。同一件衣服的不同角度只能算一件,不许拿重复照片凑数。


这是个很典型的真实工程活。


代码虽然是现成的,模型需要先读懂再修改,素材也是乱的,需要先认出哪张是衣服、哪几张其实是同一件。


先给大家看模型的产出结果,最终是这样的:


Flash模型又添一员大将:实测MiniMax M3.1


我要的是至少 100 件衣服,改造后的首页真的给我补全了。分类标签也有了数字:上装 51、套装 45、裙装 36、裤装 23。每页 24 件,一共 8 页,非常完美。每件还配了中文名和品类角标。


M3.1是怎么完成的呢?


这 4000 多张图,模型先把照片压成缩略图,然后每200张拼成一张 20×10 的「联系表」,再把这些表分给一批子 Agent分头去看。


前前后后,它一共派出去 30 个子 Agent。


Flash模型又添一员大将:实测MiniMax M3.1


每个子 Agent 只盯自己手里那几张表:哪一格是衣服,是上装还是套装,看完把结果交回主 Agent。


主 Agent 负责汇总、去重。


当然,看图只是前半截,后半截是实打实的代码活。


为了让网站兼容这些图片,它在原项目里补了一套批量导入:新增导入脚本和后台接口,每批 25 件自动拆开,还做了重复图片的去重。


除此之外,M3.1还在首页做了搜索、分类、分页的功能。


Flash模型又添一员大将:实测MiniMax M3.1


非常实用,系统用起来也没什么特明显的bug。


接手复杂代码考的是细心。下一个任务,考验眼睛。


◈二、多模态:看懂一段机器人做饭的视频


前面筛衣服,它看的是一张张静态照片。这一次,换成连续的视频。


视频比照片多了一个维度:时间。


视频相对就更难一点。机器人采回来的视频,要有人一段段标记清楚:哪一秒拿起了什么,哪只手在动,这一步到底做成没有。


这是具身智能团队每天都在干的苦活。我找了斯坦福 Mobile ALOHA 的官方演示视频:机器人自己做一盘虾,77 秒,一镜到底。


Flash模型又添一员大将:实测MiniMax M3.1


我要求:


完整看完这段视频,按实际动作变化拆解,每一段写清底座、左臂、右臂各自在干什么,物体处于什么状态。标出加油、放虾、拿铲、翻虾、倒入碗等事件;视频里没看清的写「无法确认」,不许补全。


M3.1 交回来的是一张 Excel:


Flash模型又添一员大将:实测MiniMax M3.1


时间码表拆得很细。每一行都分开写了机器人底座、左臂、右臂各自的动作。


单看右臂,几乎每一格都写着「收拢待机」。


加油、放虾这几步,都是左臂一只手干完的。


这种细节,我们只看视频很容易滑过去,但一拆成表格就藏不住了。


表格最后,它还单独列了一页「关键事件」:加油、放虾、翻虾、倒进碗……


每件事从第几秒到第几秒,一眼就能找到。


Flash模型又添一员大将:实测MiniMax M3.1


最有意思的是标粉的两行。一行是「翻虾」,它写的是:没看到,没法确认。


视频里虾始终没离开过锅面,它就不说翻过了。


另一行是「把锅放回灶上」,它写的是:没发生。锅最后被放在了台面上。


对标注数据来说,一格诚实的「无法确认」,比十格编出来的「是」更值钱。


接着,我让它把这张表做成一个能拖、能回放的网页。


基于时间码表,做一个单文件、离线可打开的「Cook Shrimp 任务回放台」。左边视频,右边事件时间轴,拖动时视频、关键帧、事件卡同步;四个任务阶段用不同颜色标出,无法确认的阶段显示灰色。不要伪造机器人控制器。


Flash模型又添一员大将:实测MiniMax M3.1


页面左边播视频,右边是一条四色进度带,对应准备、翻面、移动、倒入碗四个阶段。「翻面」那一段是灰色的,还打了个问号,因为前面那张表里,它就没能确认。


视频往前播,右边的事件卡跟着一张张亮起来。每张卡都附了一行「无法确认」,写清这一步哪里看不清。


回放台把表格里的每一格诚实,原样搬进了交互里。


◈三、数据可视化:城市在夜里亮起来了吗


前两个任务,输入都是人眼能直接看懂的照片和视频。


这一次,我给它的是一堆人眼看不懂的数字。


同一片北京,我要求模型把 2015 年 11 月和 2020 年 11 月的两份卫星夜光栅格做一个对比。


Flash模型又添一员大将:实测MiniMax M3.1


我要求:


先读文件、出数据质量报告,再做一个离线单页,标题叫「城市在夜里亮起来了吗?」。把夜光栅格抬成一块 3D 地形,拖动年份就能看到北京在夜里怎么亮起来;支持左右对比、拖动擦除和变化图三种模式。


Flash模型又添一员大将:实测MiniMax M3.1


页面打开,一条竖线从左往右扫过去,线左边是2015,右边是2020。线扫过的地方,城区的光斑一下子铺开。


地图上还叠了一层北京的城市骨架:二环到六环、中关村、奥林匹克公园、天安门、CBD、首都机场,左下角有一个小地图,用橙框标出当前裁剪的范围。


看起来非常清晰。


◈四、金融:一个市场观测台


最后是金融场景。


我要求:


用本地的 A 股数据做一个「市场天气台」。先检查数据是否新鲜、字段是否齐全,再做页面。从市场宽度、波动、回撤、板块轮动一路点到单只股票,每个数字都要能说清怎么算的。数据过期就不许写「今日行情」,不给任何买卖建议。


Flash模型又添一员大将:实测MiniMax M3.1


页面最顶上一行,先交代数据本身:数据截止2026年9月28日,标的4603只。


下面是四张卡片。


市场宽度:当天中位数收益 −1.71%,805只涨、3687只跌、100只平。


往下是一张「行业地图」。103 个行业,每个是一个圆点:越往右,最近一个月涨得越多;越往上,价格起伏越大。点哪个行业,哪个就亮起来。图下面还特意写了一句:右上角不等于「值得买」。


点进一个行业,比如林业,能看到它不同时间段的涨幅:近三个月涨了两成多,最近一个月却几乎没动。一眼就知道,这一波涨是之前的事了。


Flash模型又添一员大将:实测MiniMax M3.1


再点一层,就是这个行业里的每一只股票,点哪只都能看它的 K 线。


◈五、速度与成本


跑完 M3.1,我们把同样的 prompt 原样交给 DeepSeek V4.1 Flash 和 GLM-5.3-Flash,各跑一遍。


试衣那个任务没放进对比,先看用时: 


Flash模型又添一员大将:实测MiniMax M3.1


单看用时,DeepSeek 最快,四项里拿了三个第一;GLM 最慢,北京夜光跑了一个半小时,最后也没把页面交出来。


不过三家都是几个任务同时开跑,用时里还混着跑命令、开浏览器、截图的时间,只能看个大概。


成品质量上,差距很小。


做虾视频,三家都拆出了带时间码的动作表,思路差不多。在最难判断的「翻虾」上,M3.1和DeepSeek标成了无法确认,GLM 则给出了翻面的判断。


Flash模型又添一员大将:实测MiniMax M3.1


北京夜光,M3.1 和 DeepSeek 算出来的变亮比例都是 27.6%,数据完全对得上。


Flash模型又添一员大将:实测MiniMax M3.1


回放台三家都做出了能拖、能回放的页面,交互也差不多,M3.1 的页面更简洁一些。


A 股观测台,三家都做到了先查数据、再出页面,各有各的细节。


Flash模型又添一员大将:实测MiniMax M3.1


再看花费。


DeepSeek 这一批花了约 10 元,GLM 约 21 元。M3.1 用的是 Max 档 Token Plan,每月 119 元,一个下午用掉周额度的 10% 左右,折下来不到 3 元。


需要说明的是,GLM 这边走的是智谱官方 API 按量计费;如果换成智谱的 Coding Plan 包月套餐,同样的活会划算很多。


价格方面,M3.1 目前只能走 MiniMax Code 和 Token Plan,官方没有公布 API 单价。作为参照,上一代 M3 的 API 价格是每百万输入 0.3 美元、输出 1.2 美元。


Flash模型又添一员大将:实测MiniMax M3.1


速度方面,直接说结论:这批任务里 DeepSeek 最快,M3.1 次之,GLM 最慢。M3.1 在 A 股观测台上是三家里最快的,其余三项排在 DeepSeek 后面。


把这几个成品放在一起看,M3.1的智力未必顶尖,但作为一个 Flash 档的干活模型,DeepSeek V4.1 Flash 这回,又多了一个对手。



文章来自于微信公众号 “夕小瑶科技说”,作者 “夕小瑶科技说”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0