2026 年 7 月 31 日晚,DeepSeek 在自家 API 文档的更新日志里,发布了 DeepSeek-V4-Flash 正式版(检查点 0731)。没有发布会,没有预热海报,甚至没有一篇正式的公告文章——只有更新日志里的几段说明文字。
一年半以前,同一家公司发布 R1 模型的那个星期一,英伟达单日下跌 17%,市值蒸发 5890 亿美元,创下美股历史上最大的单日市值损失,全球财经媒体把那一天称作「DeepSeek 时刻」。而这一次,2026 年 7 月 31 日星期五,英伟达收涨 2.93% 报 200.75 美元,纳斯达克收涨 1.0%——没有任何一家主流财经媒体,把当天的行情与这次发布联系起来。
看起来像是「没有影响」。但如果把镜头拉远,这种平静本身,恰恰是过去一年半里最重要的变化:中国大模型的突破,已经从黑天鹅事件变成了市场的默认预期。震撼只会发生一次,常态才是格局。
本文把这次发布放进三个坐标系里复盘:模型本身的工程含义、全球资本市场的真实反应、以及中美 AI 竞争格局的深层变化。最后回答一个天下工厂产业研究院最关心的问题——推理成本的持续下探,对中国制造业意味着什么。
一、发布本身:以下克上的工程哲学
先看这次发布交付了什么。
V4-Flash-0731 是一个混合专家(MoE)架构模型,总参数 2840 亿,每次推理仅激活 130 亿,上下文长度 100 万 token,以 MIT 协议完全开放权重——商用、微调、再分发均无限制。官方更新日志说明,它的结构、尺寸与 4 月发布的 V4-Flash 预览版完全一致,「仅重新进行了后训练」。
关键在成绩单。按官方口径,这个 130 亿激活参数的「小」模型,在九项智能体(Agent)基准上全面反超了自家 1.6 万亿总参数、490 亿激活的 V4-Pro 预览版:Terminal Bench 2.1 从预览版的 61.8 分跃升到 82.7 分,代码仓库理解、网络安全、全栈开发等基准全部越级。而 V4-Pro 预览版在 4 月发布时,官方的措辞是「接近甚至比肩」国际最前沿的旗舰模型。国内科技媒体给这次发布起了一个准确的名字:「以下克上」(智东西的发布报道)。
第三方评测印证了官方数字。独立评测机构 Artificial Analysis 给 V4-Flash-0731 的智能指数打出 50 分,在其收录的 101 个同类模型中智能排名第三,而价格排名仅第 22 位——同价位可比模型的智能指数中位数只有 17 分(Artificial Analysis 模型页)。更直观的参照是纵向与横向的两组对比:4 月的预览版在同一指数下是 40 分,一次后训练迭代抬升了 10 分;而 50 分的绝对水平,已经与 GPT-5.6 Luna 的 51 分、Gemini 3.6 Flash 的 50 分同档——在轻量档模型的第一梯队里,第一次坐进了一个中国开源模型。
定价没有变:每百万 token 输入 1 元、输出 2 元,缓存命中低至 0.2 元,约合 0.14 / 0.28 美元——大约是自家 V4-Pro 的十分之一。
这里有一个值得所有工程组织记住的细节:这次性能跃升,一行架构代码都没有改。收益全部来自后训练——数据、方法、训练策略的迭代。它意味着在预训练规模竞赛之外,存在另一条陡峭的能力提升曲线,而这条曲线消耗的算力,比堆参数便宜得多。对一家训练算力受到外部约束的中国公司,这条路线的战略含义不言自明。
另一个细节同样耐人寻味:V4-Flash-0731 首次原生支持 OpenAI 的 Responses API 接口格式,并专门适配了 Codex 编程工具(新浪科技的报道)。换句话说,DeepSeek 主动把自己接进了竞争对手的开发者生态——用对手的接口标准,服务对手的用户,把迁移成本降到接近于零。
二、市场为什么波澜不惊
先把 7 月 31 日(周五)的收盘数据摆出来(美股个股数据引自 stockanalysis.com 历史行情页)。
美股三大指数全线收涨:纳斯达克 +1.0%,标普 500 +0.7%,道指 +0.53%,道指录得月线四连阳。但当天行情的主角写得明明白白——亚马逊财报超预期后单日暴涨 15.32%,Alphabet 涨 6.73%,微软涨 3.02%,Meta 涨 3.28%。这是一个由科技巨头财报主导的交易日。
半导体板块的走势更能说明问题。费城半导体指数当天盘中一度涨逾 5%,尾盘几乎全部回吐,收盘仅微涨 0.07%;英伟达收涨 2.93% 报 200.75 美元,AMD 收跌 1.90%,美光在前一日暴涨 18.36% 之后回落 5.90%(新浪财经当日晚报记录了这轮盘中跳水)。需要特别指出的是:半导体真正的暴涨日是前一天 7 月 30 日——微软财报引爆费半单日大涨 8.19%,7 月 31 日只是这轮暴涨后的消化日。换句话说,当周半导体行情的驱动是美国巨头的资本开支指引,而不是 DeepSeek;检索全部主流英文财经媒体,没有一篇把 7 月 31 日的行情与 V4 Flash 挂钩。
对比 2025 年 1 月,反差是戏剧性的。同样是 DeepSeek 的重大发布,R1 让英伟达单日下跌 17%、蒸发 5890 亿美元,而 V4 Flash 正式版发布当天,市场连一根像样的阴线都没有给它。原因有三层。
第一层,「低成本震撼」已经被市场充分定价。CNBC 在今年年初就有专文分析:2025 年 1 月之所以引发全球重估,是因为 R1 第一次改变了市场对前沿模型成本曲线和中国竞争力的认知;此后 DeepSeek 的每一次发布,都不再具备「认知颠覆」的属性(CNBC 的年初复盘)。今年 4 月 V4 预览版发布时,市场就已经反应平淡——咨询机构的评价是「惊喜因素去年就有了,早已计入价格」。
第二层,资本开支的叙事已经反转。R1 时刻的恐慌逻辑是「模型变便宜,巨头就不用买那么多卡了」;一年半过去,市场接受了相反的框架——效率提升带来用量爆发,即经济学里的杰文斯悖论。2026 年,Meta、微软、亚马逊、Alphabet 四家合计资本开支预计约 4750 亿美元,没有因为中国模型的降本而下修分毫。发布同日,彭博还报道了另一条消息:月之暗面通过阿里云合约锁定约 2 万块英伟达芯片——中国模型公司在抢算力,而不是省算力。
第三层,发布本身足够克制。正式版只覆盖 Flash 档位,旗舰 V4-Pro 正式版仍待发布,观察者网的标题精准地概括了这一点:「V4 正式版来了,但只来了一半」(观察者网的报道)。市场自然把最大的悬念留给了下一次。
值得单独说明的是 A 股。7 月 31 日当天,上证指数收涨 0.72% 报 3832.26 点,深证成指涨 2.21% 报 13578.93 点,创业板指大涨 3.06% 报 3343.96 点,两市成交超 2.5 万亿元,超百股涨停、零股跌停;算力硬件链条集体走强——寒武纪涨 6.10%,工业富联涨 5.39%,中芯国际 A 股涨 0.81%。但归因主要不是 DeepSeek——当天国家发改委表态「十五五」期间全国一体化算力网建设将新增直接投资 4 万亿元,叠加 7 月深度调整后的月末修复,才是主要驱动(新浪财经的收盘报道)。港股相对平静,恒生指数基本收平,7 月全月恒指累计上涨超 13%。V4 Flash 的消息通过 API 更新日志在晚间流出,A 股的独立定价要等到下周。周末的券商策略观点也印证了「常态化」的判断:银河证券策略团队认为 8 月进入「政策与业绩双重验证」阶段,AI 行情从普涨转向业绩筛选;中泰证券则维持「科技仍是主线」的判断(新浪财经 8 月 1 日的策略综述)——没有一家机构把模型发布本身当作交易信号,AI 已经从「事件」变成了「景气度」。
三、价格战攻守易位:这次先降价的是 OpenAI
如果说市场反应是「无事发生」,产业竞争层面则恰恰相反——这次发布前后 48 小时里,发生了一件时序上与直觉相反的事。
7 月 30 日,也就是 V4 Flash 正式版发布的前一天,OpenAI 宣布将发布仅 21 天的 GPT-5.6 Luna 降价 80%,输入价格从每百万 token 1 美元直降到 0.20 美元(VentureBeat 对这轮降价的分析)。一款旗舰衍生模型上线三周就打两折,这在 OpenAI 的历史上没有先例。
压力来自哪里,数据说得很直白:CNBC 7 月的调查显示,中国模型已占 OpenRouter 平台美国企业 token 用量的 46%;另有统计称中国开源模型的全球流量份额达到 66.5%,连续 13 周压过美国模型(36kr 出海版的统计报道)。换句话说,在开发者用脚投票的市场上,攻守早已易位。
更有意思的是 DeepSeek 的应对:不降价。V4 Flash 正式版维持原价,用能力升级和生态兼容来回应——性能反超自家旗舰预览版,接口直通对手生态。第三方跑分测算显示,即便在 Luna 降价 80% 之后,V4 Flash 0731 完成单个智能体任务的成本仍比对手低约 60%(IT之家的跑分测算)。当你的对手被迫降价而你可以不降价时,价格战的主动权在谁手里,一目了然。
行业评论把这个阶段概括为「智能正变得像水电一样便宜」。能力本身不再是护城河,成本结构才是——而成本结构,恰恰是中国工程体系最擅长的战场。这个剧本,中国制造业在光伏、锂电池、新能源汽车上已经演练过多次;现在,它第一次在最前沿的 AI 领域重演。
四、中美 AI 竞争:算法效率正在改写博弈规则
把视角从市场切换到地缘科技竞争,V4 Flash 的发布不是一个孤立事件,而是给三条正在演进的主线各加了一个注脚。
第一条主线:算法效率正在部分对冲算力约束。 出口管制的底层逻辑,是用先进算力的代差锁定模型能力的代差。而 V4 Flash 用一次纯后训练迭代,就让 130 亿激活参数的模型反超 490 亿激活的旗舰预览版——单位算力产出的智能,仍在陡峭上升。第三方测算显示,V4 系列在百万 token 长上下文场景下的单 token 推理计算量,只有上一代 V3.2 的 27%。当效率提升的速度快于算力封锁收紧的速度时,封锁的有效性就在边际递减。
第二条主线:软件生态的松动比芯片本身更深远。 V4 的技术报告罕见地在英伟达 GPU 与华为昇腾 NPU 双平台上做了原生工程验证,华为方面披露昇腾芯片参与了 V4-Flash 的部分训练环节,并获得了完整的适配支持(TrendForce 对昇腾适配的分析)。英伟达创始人黄仁勋在播客访谈中评价,头部模型不再默认以 CUDA 为优化起点的局面是「灾难性的」——这个词出自 CUDA 生态最大的受益者之口,分量不轻。配套的产业事实是:昇腾 2026 年总产能计划约 160 万片,国产算力第一次具备了成建制承接前沿模型的供给能力。承接速度也印证了这一点:发布次日的 8 月 1 日,超聚变 AI Lab 宣布上线 V4-Flash-0731;8 月 2 日,国家超算互联网平台上线其 API 服务、一键即可调用(新浪科技的跟进报道);华为则宣布昇腾在售全系产品同步支持 V4-Flash 与 V4-Pro。从模型发布到国产算力平台全面可用,间隔已经压缩到以「天」为单位。
第三条主线:美国内部对「封堵开源」的分歧公开化。 就在发布前一周,美国 AI 行业围绕「是否限制中国开源模型」的论战达到高点:Meta 创始人扎克伯格公开表示封禁「不会是有效的解决方案」;Anthropic 首席执行官阿莫迪虽然表达了对开源权重模型的安全担忧,但同样明确不支持封禁,称其「保护主义且无效」。科技媒体 The Register 的评论标题更直接——《没人愿意承认的真相:开源模型现在就是有竞争力》(The Register 的行业评论)。大西洋理事会的政策简报则提醒西方读者:「你能拥有的最好的 AI 是中国的」。当 MIT 协议的开放权重、近乎为零的迁移成本、以及数量级的价格优势叠加在一起时,行政手段能改变的东西,确实不多。
需要说明的是,截至本文发稿,华盛顿方面尚未对 0731 这次具体发布作出官方表态——它毕竟只是一次 API 迭代。真正可能触发新一轮政策反应的,是接下来的 V4-Pro 正式版及其是否披露训练硬件细节。
五、对中国制造业意味着什么
天下工厂产业研究院关注这次发布,最终落点不在资本市场,而在产业侧的一个朴素问题:当智能体级别的 AI 能力,价格降到每百万 token 一两元人民币时,制造业能用它做什么?
过去两年,AI 在制造业 B2B 场景的落地,卡的从来不是模型能力,而是单位经济性。用大模型逐家分析供应商资质、逐条清洗企业数据、逐段理解招投标文书,技术上早已可行,但在旗舰模型的价格下,算一笔账就会放弃。V4 Flash 这一代模型改变的正是这笔账:智能体任务单次成本进入「分」的量级,意味着原本只有头部企业才付得起的 AI 尽调、AI 选厂、AI 供应链分析,第一次具备了普惠到中小工厂和中小外贸公司的成本结构。
这也是我们正在做的事。天下工厂平台收录了全国 480 万家经过真实性识别的制造业工厂,AI 找厂服务让采购方和销售方用一句自然语言完成过去需要数天的供应商筛选。支撑这类服务的推理成本,在过去十二个月里下降了一个数量级——而这次发布告诉我们,这条成本曲线还远没有走到尽头。
对中国制造业而言,这是一个难得的结构性机会:全球最便宜的前沿 AI 能力、全球最完整的制造业体系、以及正在成型的国产算力底座,三者第一次出现在同一个坐标系里。上一次类似的要素组合出现时,中国用十年时间把光伏组件的度电成本降到了让全世界重新做能源规划的水平。
结语:安静,是成熟的声音
复盘这次发布,最值得记录的不是任何一个基准分数,而是那种前所未有的安静——发布方安静,市场安静,连太平洋对岸的反应都是克制的。
2025 年 1 月的惊涛骇浪,源于世界第一次意识到中国团队可以用十分之一的成本做出前沿模型;2026 年 7 月的风平浪静,则说明这件事已经不再需要被「意识到」了。从异常值到基准线,这是一条技术路线最好的成人礼。
接下来值得盯住的时间点:业内预期 8 月初发布的 V4-Pro 正式版及其训练硬件披露;A 股算力与 AI 应用板块对这轮模型迭代的独立定价;以及 OpenAI 降价 80% 之后,全球 API 价格体系的连锁调整。天下工厂产业研究院将持续跟踪。
封面图:天河二号超级计算机机房,摄影 O01326,源自 Wikimedia Commons,CC BY-SA 4.0 许可。