

没有任何预告,DeepSeek V4.1 Flash的中间版本deepseek-v4.1-flash-expires-on-0910开始内测了。
DeepSeek官方表示,“DeepSeek V4.1 Flash采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。”
没有技术报告,也没有性能参数表,可是官方给出的信息已经挺让人震惊的了。
V4.1 Flash是DeepSeek第一款原生多模态模型,V4 Flash Vision-Exp虽然也支持多模态,但它属于“外挂式”,在V4 Flash 0731纯文本底座上,外接了一个视觉编码器,以及一个对齐器(Aligner)。
V4.1 Flash是出厂就自带图文一体化输入输出。
并且V4正式版到V4.1才过了40天,就采用新结构,还能在提高性能的时候降低成本……这难道不该叫V5 Flash吗?
在经过社区多位技术博主的测试后,即使这个模型只是V4.1 Flash的中间版本,还不是正式版,它的表现却是相当惊艳。
01
DeepSeek V4.1 Flash牛在哪里?
就在招聘信息公布的前后,DeepSeek内部代号为DeepSeek-v4.1-flash-expires-on-0910的中间测试版本突然开启测试,测试时间截止到9月10日。
DeepSeek没有发布这个模型的技术报告,但是在官方发起的《V4.1 Flash 中间版本邀测反馈问卷》中,有这样一道题很有意思。
题目是“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”,选项分别为“可以”、“不可以”、“不确定”、“其他”。

到底能不能替代V4 Pro得先让我看看它到底怎么样。
在经过测试后发现,V4.1 Flash的速度实在是太快了。
以往我们跟大模型对话,即便响应再快,界面上往往也要跳动一两秒思考指示器。而在V4.1 Flash上,有开发者试探性地敲下一句“你好”,模型给出的思考时间只有0.3秒,生成速率瞬间飙到每秒159.3个 token,整轮对话端到端耗时仅0.8秒。
在另一组重度长文本推理的实测截图中,模型生成速度甚至直接快到了每秒420个token,端到端吞吐达409.5token/秒。
在业内人的调侃里,“这吞吐量直接把别家所谓的极速模式(Highspeed)做成了自己的日常基准”。
但这绝不仅仅是“快”那么简单,更是“又快又准”。
元股证券:ygzq.hk
博主向阳乔木将一张西装照发给了DeepSeek V4.1 Flash,模型回答说他穿的是条纹西装。
起初他以为又和V4 Flash Vision-Exp一样出现了幻觉,结果打开大图仔细一看,图中的人穿的就是条纹西装。

多位抢测的资深技术博主对V4.1 Flash与此前的V4 Flash Vision-Exp做了同任务端到端对比评测。
结果显示,在49k超长上下文检索场景下,新模型的处理速度快了5.2倍;在SVG代码生成上,快了6.0倍;在经典的Manacher回文算法题解答上,快了4.6倍;在大型SQL查询生成与优化上,快了5.0倍;在高难度的asyncio异步架构重构任务里,处理速度依然达到了前代的3.9倍。
因此,官方称V4.1 Flash采用新的结构、原生支持多模态,这话一点不假。
还没完,在实现性能暴涨的同时,它的调用价格却和V4 Flash相同。
社区中有很多关于梁文锋的梗,DeepSeek性能好价格低的时候将他尊称为“梁圣”、“梁祖”,涨价的时候又叫他“梁子”、“小梁”。
到了V4.1 Flash这里,梁文锋又当回了梁圣。
02
小鲸鱼的成人礼
就在V4.1 Flash发布的前一天,DeepSeek突然宣布释放150人的大规模招聘名额,且明确面向2至10年的资深工程师,同时也兼顾应届生与新锐人才。
这次招聘主攻两个方向。其一是服务端开发工程师,涵盖大模型研究平台、Agent 框架组件、研发效率基建、DeepSeek API、线上服务以及数据工程;其二是 Agent 弹性计算研发工程师,包含平台开发和维护、底层调优与攻坚。
作为DeepSeek Harness的负责人,崔添翼在社交平台发文称,这次扩招绝不是为了做常规业务堆人,而是因为“量的激增引发了复杂度的指数级爆炸”。
崔添翼写到:“计算机领域的任何东西量变大之后,就会产生复杂度上巨大的增加。数据的量、机器/容器的量、训练任务的量、评测任务的量、Agent 环境的量、用户的量、请求的量,等等等等,都在急剧增加。这就产生了越来越大的复杂度,会让之前的后端系统逐渐不能完美满足将来的量的需求,所以需要大量扩招人来升级、维护和重写各种后端系统。”
过去的大众认知里,DeepSeek 是几十个天才算法科学家组成的“特种部队”,凭着极致的代码洁癖和作坊式的灵感创新,打出了让硅谷侧目的战绩。然而,从首轮融资到如今的密集动作,DeepSeek 已经演进成一家数百人规模的企业。
在拿到首轮融资之前,DeepSeek的服务器在海量流量的冲击下动辄宕机,融资到位后,服务端扩容,再也没有出现过长时间宕机。
但这仅仅是解决了浅层的网页和API问题,今天的DeepSeek,它所面对的可不只是服务器压力。

从技术演进的角度来看,大模型正在经历一场从“静态预训练”走向“动态环境交互”的深刻质变。
过去训练一个语言模型,工程任务相对单纯,工程师把互联网上清洗好的海量静态文本塞进硬盘,让显卡吞吐数据。
到了现在的强化学习与Agent时代,模型为了学会解决真实任务,必须在毫秒级别内与成千上万个动态的“沙盒”实时交互。
打个比方,教模型下棋,过去是给它看千万盘死棋谱,现在则是让模型同时在十万个动态棋盘前跟自己博弈。
每一个棋盘环境的启动、状态恢复、网络隔离、结果抓取,都必须在毫秒级内完成。
原先DeepSeek作坊式的系统自己跑跑还行,扛不起这种级别的工业级动态负荷。
以V4.1 Flash这种级别的吞吐和推理速度来看,它需要极强的调度能力,才能满足这些开发者的需求。

比如哪些请求放在同一张GPU上批处理?长请求和短请求怎么混排才不会互相拖死?流量突然翻三倍的时候,从哪里秒级调资源过来?凌晨三点流量掉下来的时候,怎么自动缩容省钱?
作为一个实验室,DeepSeek不需要在乎这些问题,但现在梁文锋手下的是一家企业,这些工程问题反而成了关键。
同样的,新结构意味着DeepSeek可能要自己改推理框架、自己写CUDA算子、自己做模型压缩和量化,依然是一个极其费时费力的工程问题。
V4.1的Agent能力越强,需要的沙盒环境越多、弹性计算调度越复杂;V4.1 的多模态理解越成熟,数据管道和存储系统的压力就越大。
这150名工程师的作用就在于此。
虽说150人这个数量,不过是普通大厂一个部门的季度配额,可放在DeepSeek身上,这已经是翻倍量级的大动作。
DeepSeek已经完成从0到1的过程,现在梁文锋面对的问题,是从1如何到100,于是DeepSeek用150个HC作为回答,V4.1 Flash就成了DeepSeek的成人礼。
天才少年终究要长大,大模型也不能只停留在论文和打榜。真实世界的业务与工程骨架杠杆炒股是不是虚盘,才是这家公司长久活下去、跑赢下一轮竞争的支柱。
多空新闻网提示:本文来自互联网,不代表本网站观点。