斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5
9057点击    2026-08-25 10:41

同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?


斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。


斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5


· · ·


一次尝试,不等于模型能力上限


Terminal-Bench 2.1是平时我们在大模型评测里面经常见到的一个数据,它测的是一个AI Agent在真实的沙盒环境里,能不能完成真实终端任务。


测试一共有89个任务,评价方式就看最后任务能不能通过验证,榜单里常见的指标叫Pass@1。可以把它理解成:一次完整Agent尝试的成功率。


但我们平时让AI做复杂任务时,经常会发现一个现象:同一个模型,同一个问题,第一次可能做错,第二次可能做对;换一种思路可能失败,再换一种实现方式反而成功。


大模型生成机制本来就有随机性,尤其是Agent做终端任务时,路径很多,任何一个小决策都可能影响最后结果。


斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5


如果我们只看一次尝试,就会低估模型真实潜力。那怎么办呢?让模型多试几次吧。


可问题又来了,多试几次不难,模型能不能判断哪一次更好呢?所以实验设计了一个LLM-as-a-Verifier,让大模型当验证者。


斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5


同一个任务,先让DeepSeek V4 Flash生成5个候选方案;再让DeepSeek V4 Flash像阅卷老师一样,给这5个方案排序;选出它认为最靠谱的一个提交,最后根据这个模型认为最靠谱的任务完成情况评估模型的分数。


· · ·


DeepSeek V4 Flash一跳升天


DeepSeek V4 Flash单次尝试的原始成绩是78.7%,这个成绩本身已经不错,但还没有超过Fable 5的83.8% ±1.2%


加上自验证选优之后,DeepSeek V4 Flash的成绩跟坐了火箭一样,直接飙到了88.0% ±0.6%,超了Fable 5接近5分,而且折腾了这么多,价格依然比Fable 5便宜了4-11倍。


斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5


也就是说,准确结论不是“DeepSeek V4 Flash裸模型比Fable 5 更强”。


准确结论是:一个本来打不过旗舰模型的低成本模型,通过多次尝试和自我验证,把Agent能力推到了超过Fable 5公开榜单成绩的位置。


这有点像考试。一个学生第一次解题可能不稳定,但如果允许他列几种解法,再自己检查、比较、选一个最稳的答案,最终成绩可能会明显提高。


· · ·


为什么这招管用


这里就引出一个词:test-time scaling,中文可以理解成“做题时扩展能力”。


过去我们讲模型变强,主要讲训练时扩展:模型做得更大,数据喂得更多,训练时间拉得更长,让模型在出厂时就更聪明。这当然重要,过去几年大模型能力的提升,很大程度就是靠这个。


斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5


但test-time scaling讲的是另一件事:模型在做题的时候,多花一点时间,多打几版草稿,多检查几遍,多比较几个方案。


尤其对Agent来说,做题时扩展可能更关键。因为Agent任务往往不是一次回答,而是一个过程:观察环境、制定计划、执行命令、读错误信息、修改方案、再验证。在这个过程中,多一次尝试、多一次检查、多一个验证者,都会显著改变最终成功率。


这次DeepSeek V4 Flash的结果,本质上就是一个很典型的test-time scaling案例。


它没有证明模型本体突然变成世界第一,而是说明:当模型可以多次尝试,并且有能力自我验证时,系统能力会被明显放大。


· · ·


魔改的魅力


你可能会问,这个机制这么好用,能不能给Fable 5也加上?


当然能。闭源模型一样可以多跑几遍,再用LLM-as-a-Verifier挑出最好的结果。


但开放权重模型的优势,是这套玩法可以做得更深。不仅能在外面让模型跑5遍,还能直接控制推理过程,在关键节点分叉、提前淘汰差的路线、复用前面已经算过的结果,把算力集中到更有希望的路径上。


再加上DeepSeek V4 Flash模型本身更便宜,同样一笔钱,可以买更多次尝试,也可以把每次尝试做得更精细。模型越便宜、推理过程越可控,test-time scaling就越有性价比。


所以这个实验不是"便宜模型裸跑赢过最强闭源"的爽文。它是一个信号:一个低成本、可控、能改造的模型,只要配上更聪明的运行时机制,就有机会把系统能力推到顶级闭源模型之上。


这也正是开源最让人兴奋的地方:它把系统创新的空间打开了。开发者可以围着模型,搭出自己的一套运行时机制,让它在真实任务里,能力不断翻倍。


· · ·


关键在于用起来


最后想说一句,机制再好,关键还是需要人去用。你不动手,AI再强也跟你没关系,不管是对个人开发者还是对企业来说都是这样。


过去几年,很多公司想做AI Native转型,但最大的问题不是“不想做”,而是“不敢大规模做”,担心太贵不划算,担心数据泄露不安全,担心模型跟生产环境水土不服。


但现在这个拐点来了。


当然,AI变得便宜又好用,不代表企业自动会用好。真正难的是怎么用它重塑整个组织。


文章来自于微信公众号 “傅盛”,作者 “傅盛”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md