DeepSeek V4.1 Flash上线后,运行效率提升,内容精确度增强,并原生支持多模态功能。

全网对DeepSeek V4.1 Flash反馈积极,梁文锋再次被冠以“梁圣”称号。

与V4 Flash相比,V4.1 Flash的核心变化在于彻底重构,采用了与V4 Flash截然不同的非对称架构。

这意味着,V4在架构层面积累的训练策略、优化方法、工程适配,到了V4.1这里,大部分都失效了。

如今的DeepSeek早已不是小型工作室,而是一家拥有数百名员工的企业,重新构建新架构既耗时又费力。即便如此,梁文锋仍决心对V4进行彻底重构。

新架构听起来确实像营销噱头,但答案其实藏在DeepSeek V4.1 Flash的官方论文中:DeepSeek的旧架构已无法容纳新的训练目标。

那么这个新目标是什么呢?我认为,很可能是“入口”。

DeepSeek为何要彻底重构?

通常来说,模型在先,Harness在后。厂商根据模型的能力和特性来构建Harness。然而,DeepSeek V4.1 Flash却是被DSH“反向催生”出来的。

官方论文指出,V4.1 Flash的后训练遵循标准的SFT→RL→在线蒸馏(OPD)流程,没有任何算法上的改动。关键在于,所有实质性变化都发生在数据流水线中,即大规模自动合成Agent任务与环境,数据、任务、rollout逐步扩展。

在RL训练中,模型在6种不同的Agent框架中反复试错,数据量、任务类型、试错次数逐渐放大。DSH是这6个训练环境中最重要的一个,V4.1 Flash还专门针对DSH的不同操作模式进行了定向训练。

DSH从DeepSeek V4 Pro的附属产品,摇身一变成为V4.1 Flash的“主导者”。

为了迎合DSH的需求,DeepSeek V4.1采用了全新的架构。

论文中介绍,新架构使模型在prefill阶段每token仅激活8B参数,decode阶段激活16B,从而大幅提升“输入密集的agent工作负载”的成本效率。

为什么“输入密集”会成为问题?

过去的模型架构是为“聊天”场景设计的,用户问一句,模型答一句。这导致输入短、输出长,模型只关注当前这一轮对话的上下文。

但在Agent时代,几十轮的中间状态一直挂在上下文中,输入动辄几十万token,远超输出。

2026年4月,密歇根大学、斯坦福大学等院校联合发表论文《AI是怎么花你钱的?》(How Do AI Agents Spend Your Money?),其中提到,在agentic代码任务中,输入与输出的token比高达154:1。

因此,DeepSeek选择了彻底重构。V4.1 Flash采用了非对称架构Causal-Encoder-Decoder(CED)。

V4.1 Flash的语言主干共40层,如果按照传统的Transformer(decoder-only)架构,这40层应完全相同。每一层都同时负责“读”和“写”,处理输入和输出,且每层都要自己维护一份KV Cache。

CED的“非对称”体现在,将这40层拆分为前20层编码器和后20层解码器。编码器只负责“读”,将输入压缩为摘要;解码器只负责“写”,根据摘要生成回答。

就像汽车流水线一样。过去是一个车间完成所有工序,要增加产能就得不断复制这个车间。现在是流水线,冲压车间只负责冲压,电泳车间只负责电泳。

并且记忆只产生一次,解码器的全局KV Cache直接从编码器的最终结果投影而来。DeepSeek V4.1 Flash的全局KV Cache压缩至890字节/token,降低至V4 Flash的1/4。

这是因为DeepSeek V4.1 Flash采用了CSA2(Compressed Sparse Attention 2),第二代压缩稀疏注意力。

在V4时代,DeepSeek使用的是第一代CSA。到了第二代,不同层之间可以共享KV和索引,从而解决了前面提到的痛点。

同样像汽车流水线一样,CSA2将这40层分为三个不同的车间:Full、Reindex和Reuse。

Full负责完整记录,如同传统Transformer的每一层。Reindex负责提炼重点,并根据结果执行操作。Reuse则直接复制Full的记录,连提炼都省了。

虽然第一层用Full,其余39层全用Reuse是最节省成本的做法,但每层关注的重点不同,能力也不同。浅层做“字面理解”,深层做“逻辑推理”,它们需要的上下文内容不同。如果全用Reuse,只会生成没有价值的回答。

去年还是先有车、再修路,今年已经是先修路,再造车。

模型性能强弱、性价比高低,都不是叙事的核心。唯有掌握了入口,才能吸引更多用户。

但梁文锋不是第一个这么做的,姚顺雨的Hy4 preview走在他前面。

Hy4 preview官方技术报告显示,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们实际交付的工作共建数据,再与CodeBuddy、WorkBuddy等产品共同设计。

在163名内部专家参与的203个真实工程任务盲测中,Hy4 preview平均2.99分,GLM-5.3是2.92,Kimi K3是2.94。

入口的重要性不言而喻,腾讯产品矩阵的优势得以发挥。

DSH和WorkBuddy本质上是一种产品闭环,是整个训练流水线的一部分。

有趣的是,2026年7月24日,腾讯撤销大语言模型部和多模态模型部,合并成立基础模型部,由姚顺雨统一负责。他将混元多模态的发展重点放在Agent强相关的多模态理解上,这与梁文锋此前对多模态的看法一致。

如今,梁文锋又在模型上向姚顺雨靠拢,互相学习。

智谱与Kimi有类似的闭环吗?

智谱和月之暗面这两家并非没有工具,Kimi有Kimi Claw,智谱也有ZCode、AutoClaw和GLM Coding Plan。

但这些工具无法像DSH和WorkBuddy那样“反哺”模型。智谱和Kimi的工具是后挂的外壳,模型先在合成环境中训练好,再做成产品给用户使用。

智谱目前将所有精力都放在模型自进化上。8月31日,在智谱半年度业绩会上,唐杰首次明确表示,GLM-6.0是一款Full Self-Training(完全自训练)模型,与OpenAI的RSI(Recursive Self-Improvement,递归自我改进)相似。

唐杰表示,从预训练、中训练到后训练,全流程让模型自己训练自己,不再依赖人写代码、清洗数据、调参、设计实验。人只负责给模型设定目标,以及做最后的验收工作。

在GLM-5.3上,智谱已经展示过他们自进化方法的一部分。GLM-5.3和5.2使用的基座相同,但性能大幅提升。

具体情况是这样的:GLM-5.3建立了一套端到端的任务环境合成流水线。Agent从真实世界的软件工程和终端操作场景收集种子任务,然后模型自己头脑风暴,生成大量可验证的任务草稿,再构建做题用的Agent,将这些草稿实例化为具体的可运行环境。

将Agent输出的回答进行精炼,根据研究员定义的评分标准,检查并迭代优化任务质量。

最终产出了数千个多样化、可验证的终端Agent环境。GLM-5.3的长程任务环境数量是GLM-5.2的几十倍,而且都是Agent自己构建的。

月之暗面走的是“在自建合成环境中将Agent能力练到极致”的路线,相当于闭关修炼。

具体做法是通过AgentENV来完成模型训练,这是基于Firecracker微虚拟机的分布式沙箱系统。

在K3训练期间运行了5100万个沙箱,支持暂停、恢复、复制、快照,专门解决长程Agent强化学习中“任务跑不完、环境容易污染”的基础设施难题。

Agent的强化学习训练与普通大模型RL不同。普通RLHF就是给模型一个prompt,模型生成一段回答,打个分,更新参数。环境是无状态的,跑完就结束。

但Agent训练不一样。模型要在真实运行环境中工作,一个任务可能跑几十步甚至几百步,持续几分钟到几小时。

如果在工作过程中,模型发现缺少某个依赖,它会为了完成任务,自己在沙箱中安装依赖、修改配置文件。

虽然任务完成了,但环境也随之改变,即环境被污染了。那么下一轮训练不能接着用,需要重新启动一个干净环境。重启过程大约需要几秒,虽然不长,但大规模训练时会浪费大量时间。

就像学开车一样,如果一上来就从科目三开始,那必定会成为马路杀手。所以需要驾校,准备一个没有行人和来往车辆的空地,练习起步、上坡和侧方停车。

AgentENV就是Kimi的驾校,让Kimi在训练时可以大展拳脚,而不受环境因素的影响。

所以智谱和月之暗面并非没有闭环,只是这个闭环没有触及外界,练得再好也是闭关修炼。

DSH和WorkBuddy是入口,用户在真实环境中工作,数据自然回流,模型在实战中被养大。

梁文锋要抢入口

就在DeepSeek V4.1 Flash发布的同时,DSH也宣布更新到v0.1.5版本。新版为插件作者提供了更多标准化的UI扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了UI的性能与交互,并持续增加与模型研究前沿深度结合的实验性功能。

DSH刚发布时,与其说它是一个产品,不如说它是一个属于极客的玩具。就连安装都能难倒一大批人。

DSH的理念是一切皆插件,需要用什么插件,DSH自己安装,用完了再删除。结果就是真正好用的插件,全是社区提供的,包括UI都是。

到了0.1.5版本,DSH已经从“框架”逐渐蜕变为“产品入口”。除了适配V4.1 Flash以外,全是终端用户产品功能。

举个例子,0.1.5版本中,Agent可以显式交付文件。生成的代码、文档、分析报告直接作为文件出现在侧边栏,用户可以预览、打开、定位到本地文件夹。

以前的DSH中,Agent只能输出文字和代码到回答框里,用户必须亲自复制粘贴到文件中才行。

不仅如此,新版本还有一个极其实用的功能,叫做“支持在保留已有KV Cache的情况下更新系统提示词”。

传统Agent有一个痛点:长会话运行到一半,你想改系统提示词,比如让Agent从“写代码模式”切换到“写文档模式”,那就必须清掉整个KV Cache重新prefill。

在1M上下文的前提下,切换系统提示词,意味着Agent要花几十万甚至上百万token去重新规划任务。

所以现有Agent产品基本不允许中途修改系统提示词,Agent的角色和目标从会话开始就锁死了。

这说明,DeepSeek在有意识地将DSH从“极客工具”向前推进,使其成为面向更多用户的Agent产品。核心目的在于扩大入口,让更多人进来。

现在的DeepSeek,反而有点像卖剃须刀的吉列。它的刀架不赚钱,甚至免费,它主要挣的是刀片的钱。但真正锁定客户的却是刀架。

DeepSeek也一样,想换新模型,复制粘贴一段API Key就完事了。但想换新Harness,那需要适应很长一段时间。

所以DSH大量优化用户体验,不仅仅是为了继续“反哺”未来的DeepSeek V4.1 Pro,乃至5、6、7、8,更是为了抢占入口。

DeepSeek已经在朝着“入口公司”的方向发展了。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。