序章:推演,不是预测

本文要做的事情,是推演工厂数据在 2026 年到 2031 年之间可能走上的几条路径。

先说清楚「推演」与「预测」的区别,因为这个区别决定了全文的写法。

预测是给出一个结论:五年后会怎样。推演是给出一组条件:如果某些已经在发生的事情继续发生、并在某个节点上分出岔路,那么每条岔路上会发生什么,以及怎样在岔路出现之前就看见它来了。

预测的价值在于对错,推演的价值在于让人提前知道该盯着什么看。

这套方法有明确的来源。1970 年代,壳牌公司的规划部门放弃了对油价的单点预测,转而构建几个内部自洽、彼此不同的「情景」,让管理层在每个情景下预演自己的决策。它的用处不是猜中了 1973 年的石油危机,而是让一家公司在危机来临时不需要临场理解发生了什么——它已经在其中一个情景里演练过了。

本文借用这套方法,但给自己加了三条比通常的情景分析更严格的规则:

规则一:只推演由已发生事实驱动的分叉。 每一个情景的驱动力,都必须能追溯到 2026 年 9 月之前已经公开的政策文件、统计数据、市场事件或技术指标。本文不引入「假如出现某项颠覆性技术」这类无法从现有事实推出的假设。

规则二:每个情景都附带先行信号与证伪条件。 先行信号是「如果这条路径正在被走,你会先看到什么」;证伪条件是「如果看到了什么,说明这条路径已经关闭」。不给这两样的情景,只是故事。

规则三:不给概率。 本文不会说「情景 A 有 40% 的可能性」。概率数字在这类分析中几乎总是伪精度——它给了读者不该有的确定感,而它本身没有任何可核验的依据。本文给的是条件:在什么条件下哪条路径更可能,条件是否成立可以被观察。

这三条规则是本系列前两篇文章方法论的延续。第一篇讨论当代产业数据时反复强调「每个数字都必须挂一个口径」,第二篇回顾一百二十年时反复强调「每一代人都以为自己的工具足够好了」。推演未来时,这两条教训合起来就是:不要用没有口径的数字讲一个自己相信的故事。


推演的对象需要先划定边界。

本文说的「工厂数据」,与前两篇一致,指的是以「一家具体的工厂」为单位组织的、带产业属性的、可持续更新的数据:它是不是真在生产、在造什么、产能多大、在哪里、谁能拍板、现在还在不在。这一层数据处于工商登记信息之上、企业内部生产数据之外,第一篇把它称为「第一公里」,第二篇把它的历史追溯到 1931 年那份二十五项的登记附表。

推演的时间窗是五年:2026 年到 2031 年。选五年有两个理由。其一,它覆盖了「十五五」规划的完整周期(2026—2030)再加一年,现有的主要政策目标——「数据要素×」三年行动计划收官、可信数据空间建成 100 个以上、行业高质量数据集建设行动、「人工智能+制造」1000 个工业智能体——全部落在这个窗口内。其二,五年是技术曲线可以被合理外推的最长时间;再往后,本文的规则一就无法满足。

推演的结构分六部:第一部列出 2026 年已经锁定的基线;第二部拆出七个驱动变量,逐一说明它们的现状、方向、可观测指标与不确定度;第三部构建三个情景;第四部标出分叉点与观测清单;第五部讨论不同主体在每个情景下的稳健策略;第六部写下什么会证伪本文。


最后要交代一件事:本文的立场。

本系列的作者是天下工厂产业研究院,其所属平台本身就是第一公里上的一家从业机构。这意味着本文对某些路径的判断,不可避免地带有从业者的视角。处理这种利益关系的办法不是假装它不存在,而是把它写明,并且用规则一到规则三把每一个判断都锚在可核验的事实上——读者可以不同意本文的判断,但应当能看见判断的依据。

在三个情景中,有一个情景对现有的数据加工者是不利的——模型的能力强到足以自行组织公开信息、专门的加工层被吸收。本文把它作为一个完整的情景来推演,给它与另外两个情景同等的篇幅,并且如实写出它的先行信号。这是本文对自身立场的最基本的约束。

推演开始。

第一部 基线:2026 年已经锁定的量

推演的第一步是确认起点。下面八章列出的,是到 2026 年 9 月为止已经发生、已经公开、在五年窗口内不会逆转的事实。它们不是变量,是常量——任何一个情景都必须建立在它们之上。

一、基线一:52.26 ZB 与 1%

2025 年,全国年度数据生产总量 52.26 ZB,同比增长 27.28%,占全球约 27.44%;全国数据存储总量 2.53 ZB;结构化数据存储量 0.56 ZB,占存储总量的 22.13%,占生产总量约 1%。这组数字来自国家数据局 2026 年 4 月发布的《全国数据资源调查报告(2025 年)》。

从这组数字可以锁定三个判断。

其一,数据生产的增长在五年内不会停。 27.28% 的增速已经连续三年加速,增长的主要来源是企业数据,其中工业制造的数据生产量增幅居首。即便增速回落到 15%,到 2030 年全国数据生产总量也会接近 100 ZB 量级。数据不会短缺。

其二,结构化率的提升是缓慢的。 结构化存储量的增速(43.59%)高于生产总量增速,「剪刀差」在缩窄,但基数只有 1%。按现有增速差外推,五年后结构化数据占生产总量的比例仍在个位数百分比。也就是说,到 2031 年,绝大多数数据仍然是非结构化的——这是所有情景共同面对的原料形态。

其三,「把非结构化变成可用」这道工序的重要性只会上升。 生产越多、结构化率越低,加工的杠杆就越大。这条判断在三个情景里都成立,区别只在于加工由谁完成、以什么方式完成。

二、基线二:404.9 万、480 万与 43.6 万

到 2026 年,中国制造业主体的规模有三个可以并列的口径:第五次全国经济普查口径下 2023 年末制造业法人单位 404.9 万个;天下工厂产业平台口径下经多源信号判定有实际生产活动的工厂档案 480 万家;国家统计局口径下 2025 年末规模以上工业企业约 43.6 万家。

三个数字锁定的判断是:主体规模在数百万量级,且这个量级在五年内不会改变。 第二篇已经证明,这个量级从 1995 年起就稳定了。五年内无论经济周期如何,新增与退出的主体会在几十万量级上波动,但不会把总量推出数百万这个区间。

这意味着任何一套「全国工厂数据」的存量记录,在五年内都要维持在数百万条的规模,而其中每年需要核验更新的比例——按第一篇对字段半衰期的分析——不会低于三分之一。核验的绝对工作量是确定的,且很大。 这是三个情景中「谁来做核验」这个问题的共同前提。

还有一个从口径差异里锁定的判断:404.9 万与 480 万之间的差距——主要来自个体工商户形态的加工主体和登记在其他门类的实际生产者——在五年内不会被登记制度自动弥合。登记体系服务于信用监管,产业属性不是它的任务。这条边界第二篇讲得很清楚,五年内没有任何已公开的政策打算改变它。

三、基线三:制度屋顶已经封顶

从 2022 年 12 月「数据二十条」到 2026 年 2 月四部门培育数据流通服务机构的意见,数据要素的制度框架已经完整:产权(三权分置)、登记(数据产权登记)、会计(数据资源入表)、定价(公共数据授权运营价格形成机制)、设施(可信数据空间、国家数据基础设施)、机构(交易所、流通服务平台、数据商三类)、安全(数据安全法、个人信息保护法、网络数据安全管理条例)。

2026 年,「十五五」规划纲要首次提出「建设开放共享安全的全国一体化数据市场」,并部署「完善数据产权结构性分置制度,构建全国统一的数据产权登记体系」「建立全国数据资源『一本账』」「建设和运营国家数据基础设施,实施可信数据空间发展行动计划」。

这些锁定了一件事:五年内制度的方向不会反转。 数据要素市场化、产权分置、登记体系、一体化市场,是「十五五」的既定任务,不会在中途改向。三个情景的区别,不在于制度往哪个方向走,而在于制度落地时,加工环节的价值由谁获得。

同时也锁定了另一件事:制度层面对「加工环节」的具体激励,到 2026 年 9 月为止仍然是原则性的。 「数据商」有了分类,没有配套的培育办法;准许成本加合理收益的定价只覆盖公共数据;入表以成本计量、不允许评估值。加工环节的激励是否会在五年内从原则变成细则,是第二部要讨论的变量之一,不是基线。

四、基线四:37.86 亿元与成本计量

截至 2026 年 4 月 30 日,A 股 136 家上市公司披露数据资源入表,合计 37.86 亿元;截至 2026 年 3 月 31 日,417 家非上市公司披露入表,其中制造业 32 家为最多。2025 年 12 月,财政部等四部门明确数据资源以成本计量,不得将评估值直接作为入账依据。

锁定的判断有两条。

其一,入表规模在五年内会增长,但增速受成本计量的约束。 只要「以成本计量」不变——五年内没有任何迹象表明会变——入表金额就只能反映历史投入,不能反映市场价值。这决定了入表不会成为数据资产化的主要通道,它的作用是倒逼企业做数据治理。

其二,制造业将继续是入表数量最多的行业之一。 原因第一篇分析过:制造业数据有明确的物理对应,成本容易归集;有地方补贴驱动;有真实的融资诉求。这三个原因五年内都不会消失。

从这条基线可以推出一个对情景很重要的含义:数据加工者的投入,在五年内仍然主要以费用而不是资产的形态存在于报表上。 这影响它们的融资能力,也影响它们能承受多长的投入周期。

五、基线五:场内 5% 与 60 家交易所的整合

截至 2026 年初,全国数据交易机构超过 60 家,2025 年场内交易规模约 2000 亿元,北京、上海、广州、深圳、贵阳五大头部占比超过 70%;场内交易约占数据流通市场的 5%。2026 年 2 月四部门意见明确「严控数量,适时开展整合优化」。

锁定的判断:五年内交易所数量会减少,头部集中度会上升,但场内占比不会成为主流。 这不是对交易所的否定,而是数据交易本身的性质决定的——确权、合规、定价、安全交付这四个核心痛点,挂牌撮合解决不了;企业之间的点对点交易仍将是主流形态。

对情景的含义:工厂数据的流通,五年内主要不会经过交易所。 它会以接口调用、点对点合作、嵌入应用的形式发生。交易所在三个情景中的角色,是登记与合规的基础设施,不是流量的主渠道。

六、基线六:280 倍与 988 款

技术侧有三个已经锁定的量。

推理成本。 斯坦福 AI Index 的统计显示,达到 GPT-3.5 水平的模型推理成本,从 2022 年 11 月的每百万 token 约 20 美元,降低至 2024 年 10 月的 0.07 美元,两年降幅超过 280 倍;同期 AI 硬件成本平均每年下降约 30%。到 2026 年,国内主流模型的 API 定价已经进入每百万 token 输入一元以下的区间。

这锁定的判断是:用大模型处理非结构化文本的边际成本,五年内会继续下降,且下降幅度以数量级计。 第一篇说大模型「让边际成本从人力变成算力,但没有让它变成零」——五年之后,「不为零」仍然成立,但它离零的距离会近得多。

接口协议。 2024 年 11 月提出的 MCP 已被主流模型客户端与开发工具采纳;企业信息查询工具在 2026 年已以 MCP 提供 179 个原子能力;面向产业属性的工厂数据平台已以 MCP 与 REST 双门面提供服务。锁定的判断:机器对机器的数据调用,五年内会成为数据产品的主要交付形态,人机界面退居其次。

合规准入。 截至 2026 年 6 月 30 日,累计 988 款生成式人工智能服务完成备案、598 款应用或功能完成登记。锁定的判断:面向公众提供模型能力的门槛已经制度化,五年内只会更规范,不会放松。

七、基线七:需求侧的三个确定量

需求侧有三个已经写进文件或统计的量。

外贸主体。 2025 年有进出口记录的经营主体超过 78 万家,民营企业占进出口总值的 57.3%。欧盟《企业可持续发展尽职调查指令》2024 年 7 月生效并经综合法案修订,链式传导仍在。锁定的判断:境外买家对中国工厂「可核验数据身份」的需求,五年内只增不减。

工业智能体目标。 2026 年 1 月八部门文件提出到 2027 年推出 1000 个高水平工业智能体、100 个工业领域高质量数据集、500 个典型应用场景;2025 年 8 月国务院文件提出到 2027 年智能体等应用普及率超过 70%,2030 年超过 90%。锁定的判断:未来五年会有大量面向制造业的智能体上线,它们对外部产业主体数据的调用需求是新增的、此前不存在的需求。

高质量数据集。 截至 2026 年 8 月已建成 12.6 万个、1815 PB,半年增长近一倍;行业高质量数据集建设行动的目标定在 2028 年底。锁定的判断:「加工有价值且可被支付」这件事,在模型训练数据这条线上已经被市场证明。 它是工厂数据这条线最近的参照。

八、基线八:三条硬线

最后是合规的三条硬线,它们划定了所有情景的边界。

国内。 《网络数据安全管理条例》自 2025 年 1 月 1 日起施行,细化了个人信息保护、重要数据安全管理、网络数据跨境安全管理、网络平台服务提供者义务等方面的要求;《促进和规范数据跨境流动规定》自 2024 年 3 月起放宽跨境条件、收窄安全评估范围。锁定的判断:涉及个人信息的工厂数据字段(决策人联系方式),五年内的处理规则只会更明确、更严格;不涉及个人信息与重要数据的企业公开信息,流通与出境的合规负担相对较轻。

美国。 加州《删除法》(Delete Act)于 2023 年 10 月通过,建立数据经纪商登记制度;其核心机制「删除请求与退出平台」(DROP)自 2026 年 8 月 1 日起进入强制合规阶段,所有注册经纪商必须接入并每 45 天处理一次删除请求。注册数据经纪商数量从 2025 年 6 月的 459 家增至 575 家以上;加州隐私保护局 2025 年 11 月成立数据经纪商执法打击部队,已对未登记经纪商开出罚单,两家 B2B 销售线索类公司分别支付约 35,000 美元和解金。《删除法》不设适用门槛——规模再小的企业只要符合定义就须注册。锁定的判断:「向第三方出售与己方无直接关系的个人数据」这类业务模式,在主要海外市场的监管压力五年内持续上升。

欧盟。 《数据法案》(Regulation (EU) 2023/2854)2024 年 1 月生效、2025 年 9 月 12 日正式适用,针对联网产品与关联服务产生的数据赋予用户访问与共享权利,违反数据共享义务最高可处上一年度全球营业额 4% 或 2000 万欧元的罚款。锁定的判断:设备产生数据的访问权在欧盟已经法定化,这为「企业内部生产数据」的流通打开了制度通道,但它不直接涉及本文讨论的「企业外部产业主体数据」。

三条硬线合起来划出的边界是:企业公开信息的加工与流通,空间是开放的;个人信息的加工与流通,空间是收紧的。 三个情景都在这条边界之内展开。


八条基线到此列完。它们共同构成一个起点:数据在高速增长且大部分非结构化;主体在数百万量级且核验工作量确定;制度方向已定但加工激励未细化;入表以成本计量;流通主要在场外;推理成本以数量级下降;智能体需求是新增的;合规边界对企业信息开放、对个人信息收紧。

在这个起点上,什么东西是不确定的?下一部拆出七个变量。

第二部 七个驱动变量

基线是常量,变量是分叉的来源。本部拆出七个变量,每一个都按同样的四段来写:现状、方向、可观测指标、不确定度。 可观测指标是这一部最重要的内容——它们是第四部「观测清单」的来源,也是读者在五年内自行检验本文的依据。

九、变量一:模型能否自己去查

现状:到 2026 年,主流大模型普遍具备联网检索能力:给定一个问题,模型可以发起搜索、读取网页、整合结果。这个能力已经足以回答「某家公司的官网上说它做什么」这类单点问题。但它有明确的限制:一次对话中能读取的网页数量以十计,不以万计;每次检索的结果受搜索引擎排序影响,不可控;两次相同的提问可能得到不一致的答案;对需要跨几十个来源交叉验证的问题(「这家企业是不是真工厂」),实时检索的可靠性远低于预先加工好的数据库。

方向:模型的上下文长度、工具调用的并行度、检索的可控性都在提升。五年内,一个模型智能体在一次任务中扫描几百个网页并做初步交叉验证,在技术上是可以预期的。但「扫描全国几百万家企业的公开信息并持续维护」这件事,与「回答一个具体问题时临时扫描几百个网页」是两个数量级不同的任务;前者在五年内看不到由模型实时完成的路径。

可观测指标:

  • 主流模型单次任务可稳定读取的网页数量(当前量级:数十);
  • 模型对「某企业是否为真实生产商」这类判断题的准确率,在有预加工数据与无预加工数据两种条件下的差异;
  • 模型客户端中,「实时检索」与「调用预加工数据源」两种模式的使用占比。

不确定度:高。这是七个变量里最不确定的一个,也是情景 C 的核心驱动力。本文的判断是:五年内模型的实时能力会显著削弱「浅层查询」类数据产品的价值(查一家企业的基本情况),但不会替代「全量加工加持续核验」类数据产品(找出全部符合条件的企业并保证名单有效)。这个判断的把握度不高,第六部会写明它的证伪条件。

十、变量二:推理成本曲线

现状:两年 280 倍的降幅是过去的数据。到 2026 年,主流模型 API 输入价格已进入每百万 token 一元以下;对全量企业文本做一遍大模型抽取的成本,已经从「不可承受」降到「可以规划」。

方向:继续下降,但降幅会放缓——前两年的降幅有相当部分来自从「无竞争」到「有竞争」的一次性调整,此后的下降更多依赖架构与硬件的渐进改进。AI 硬件成本年均下降约 30% 是一个可参照的长期斜率。

可观测指标:

  • 主流模型每百万 token 的输入与输出定价,按季度跟踪;
  • 对一条典型企业文本(约 2000 字)做结构化抽取的单次成本;
  • 数据加工机构披露的「算力成本占加工总成本的比例」。

不确定度:低。方向确定,只有斜率不确定。它对情景的影响是放大器:成本越低,情景 C 越有可能(模型自己做加工的门槛降低),同时情景 B 也越有可能(现有加工者的边际成本更低、覆盖更全)。这个变量本身不决定分叉,它决定分叉发生的速度。

十一、变量三:公共数据开放的深度

现状:到 2026 年,基础登记信息已经是公共品(全国一张网),公共数据授权运营在 25 个省铺开,「十五五」纲要提出建立全国数据资源「一本账」。但公共数据开放的内容,到目前为止仍以登记、许可、处罚、年报这类合规信息为主。产业属性——生产活动、产能、工艺——不在公共数据的现有范围内,因为没有任何政府部门采集这类信息。

方向:「一本账」意味着政府内部各部门数据的汇聚会加深——税务、社保、海关、用电、用水、环评、安监,这些部门各自掌握的数据合起来,实际上已经能相当准确地推断一家企业是否在生产、规模多大。问题是这些数据是否会以某种形式向社会开放,以及以什么粒度开放。

可观测指标:

  • 公共数据授权运营中,是否出现「企业经营活性」类产品(基于税务、社保、用电等多部门数据推断企业是否在正常经营);
  • 各省公共数据开放目录中,企业类数据的字段数量与更新频率;
  • 是否有省级或国家级的「企业画像」类公共数据产品面向市场提供。

不确定度:中。方向是加深汇聚,不确定的是开放。这是情景 A 的核心驱动力:如果政府汇聚的多部门数据以「企业经营活性画像」的形式通过授权运营向市场提供,那么商业加工者今天做的一大部分工作——从公开痕迹推断企业是否在生产——会被更准确的公共数据产品替代。

十二、变量四:加工环节的制度激励

现状:到 2026 年 9 月,加工环节的激励仍是原则性的:数据商有了分类没有培育细则;准许收益定价只覆盖公共数据;入表以成本计量;高质量数据集有专项行动和基地支持,但那是模型训练数据这条线,不是产业主体数据这条线。

方向:「十五五」期间数据产业的培育政策会陆续出台,数据商的培育办法大概率会有。但激励的形态有很大不确定:是财政补贴(补建设)、是采购(政府作为买方购买数据服务)、是准入(给数据商特定资质)、还是税收(对数据加工投入的优惠)?不同形态对情景的影响完全不同。

可观测指标:

  • 国家或省级层面是否出台「数据商培育」的具体办法,以及办法中是否有针对「通用产业数据底座」的支持条款;
  • 政府采购目录中是否出现「企业画像 / 供应链数据服务」类采购项;
  • 数据资产入表规则是否出现针对「持续核验投入」的资本化路径。

不确定度:中高。这是情景 A 与情景 B 之间的分水岭之一:如果激励以「政府建底座、市场做应用」的形式出现,走向情景 A;如果以「补贴或采购市场化底座」的形式出现,走向情景 B。

十三、变量五:口径会不会统一

现状:第一篇第 21 章和第二篇「口径的谱系」讨论过,「什么算工厂」在 2026 年至少有七种口径并存,商业加工者各自定义,彼此不可比。「十五五」纲要提出构建全国统一的数据产权登记体系——这是登记的统一,不是口径的统一。

方向:两条可能的路径:一是标准化机构制定国家标准(类似高质量数据集已有的 5 项国家标准),二是市场竞争产生事实标准(某家机构的口径被广泛引用)。两条路径都有困难:产业属性的判定与用途强相关,国家标准难以覆盖所有用途;商业机构在公共标识符之上建立事实标准的难度,比邓白氏在无公共标识符条件下大得多。

可观测指标:

  • 全国数标委或行业协会是否立项「企业生产活动判定」「制造业主体分类」类标准;
  • 主要商业数据机构是否公开各自的判定规则与口径文档,以及是否出现跨机构的口径互认;
  • 政府统计与商业数据在同一区域、同一行业的主体数量对照,差距是否在收窄。

不确定度:高。本文的判断是:五年内不会出现统一口径,但会出现「口径披露」的规范——各家必须说明自己的定义,而不是各说各话。这个判断对三个情景都有影响:口径不统一,情景 A 的公共底座就难以与市场数据对接,情景 B 的事实标准就难以形成,情景 C 的模型整合结果就更不可靠。

十四、变量六:合规收紧的速度与方向

现状:基线八已经列出三条硬线。到 2026 年,企业公开信息的加工空间是开放的,个人信息(联系方式)的空间在收紧。加州《删除法》的强制合规阶段刚开始,其「向第三方出售无直接关系的个人数据即须注册」的宽定义,对 B2B 数据业务的影响正在显现。

方向:国内对个人信息的处理规则会继续细化;海外对数据经纪商的登记与删除义务会扩散到更多司法辖区。对企业公开信息的加工,各主要法域都没有收紧的迹象——欧盟《数据法案》甚至在扩大数据访问权。

可观测指标:

  • 国内是否出台针对「企业联系人信息商业化处理」的专项规则或执法案例;
  • 加州 DROP 平台上线后,B2B 数据类公司的注册数量与处理删除请求的规模;
  • 其他州或国家是否跟进数据经纪商登记制度(新泽西已通过类似法案);
  • 国内数据抓取类不正当竞争案件的判决走向,「三阶审查」框架是否被更高层级的裁判确认。

不确定度:中。方向清楚(企业信息开放、个人信息收紧),不确定的是速度和边界的具体位置——尤其是「工作场景下已公开的联系方式」在国内的处理规则会不会有专门的细化。这个变量对三个情景的影响是同向的:它决定「决策人联系方式」这一格在五年后还能不能作为商业数据产品存在,以及以什么形态存在。

十五、变量七:需求侧的形态

现状:第一篇把工厂数据的需求方分为三类:向工厂销售的人、寻找工厂的人、接入数据的人。到 2026 年,第一类是付费主力,第二类在增长,第三类因 AI 应用爆发而快速增长。智能体的普及目标(2027 年超过 70%)和工业智能体的建设目标(1000 个)意味着第三类需求会在五年内成为最大的调用量来源。

方向:调用量从人的查询转向机器的调用,量级会上升一到两个数量级;单次调用的价值会下降;对数据的确定性、结构稳定性、错误编码的要求会上升。

可观测指标:

  • 主要数据平台披露的「人工查询」与「接口调用」的量级比;
  • 面向制造业的智能体产品中,接入外部产业主体数据源的比例;
  • 按次计费的数据产品的单价走势与总调用量走势。

不确定度:低到中。方向确定,量级不确定。这个变量决定了三个情景下市场的总规模,但不决定分叉方向。


七个变量列完。把它们按「对分叉方向的影响」分类:

  • 决定分叉的变量:变量一(模型能否自己查)、变量三(公共数据开放深度)、变量四(加工激励形态)。这三个变量的不同组合,直接对应三个情景。
  • 决定速度与规模的变量:变量二(推理成本)、变量七(需求形态)。它们放大或缩小每个情景的幅度,不改变方向。
  • 决定边界的变量:变量五(口径)、变量六(合规)。它们限制每个情景能走多远。

下一部用前三个变量的组合,构建三个情景。

十六、七个变量的相互作用

七个变量不是独立的。它们之间有放大、抵消、前置的关系,理解这些关系比单独看每个变量更重要——因为分叉往往不是由一个变量的变化触发的,而是由两个变量的组合触发的。

下面列出六组最重要的相互作用。

变量一 × 变量二:模型能力与推理成本互相放大。 模型能力的提升(能读更多网页、做更多交叉验证)与推理成本的下降(读同样多的网页更便宜)指向同一个方向:让「用时现做」的加工越来越可行。两者叠加,是情景 C 的引擎。但它们也同时降低了情景 B 底座的加工成本——底座也用模型做抽取。所以这一组相互作用不决定分叉方向,只决定所有路径的速度:它让 A、B、C 三个情景都来得更快。

变量三 × 变量四:公共开放与激励形态决定 A 与 B 的分野。 这一组是最关键的相互作用。四种组合:

  • 公共高开放 + 激励为「政府建底座」→ 情景 A 的典型形态;
  • 公共高开放 + 激励为「补贴或采购市场化底座」→ 分层组合,公共层与商业层并存,商业层集中在产业属性;
  • 公共低开放 + 激励为「补贴或采购市场化底座」→ 情景 B 的典型形态;
  • 公共低开放 + 激励缺位 → 情景 B 的慢速版本,底座依赖交叉补贴,集中度上升更慢。

四种组合中,第二种是本文第六部「分层组合」的基础,也是本文认为最可能的形态。

变量三 × 变量六:公共开放受合规边界约束。 公共层要向市场提供企业活性产品,必须处理税务、社保、用电数据在企业层面聚合后的商业秘密与个人信息问题。合规收紧的方向(变量六)会直接限制公共层产品的粒度——脱敏越严格,产品越粗,可用性越低。这一组相互作用意味着:情景 A 的公共层即便建成,也可能因为合规约束而只提供粗粒度的经营状态判断(正常、异常、停业三档),而不是细粒度的规模与趋势。

变量一 × 变量六:模型实时抓取受合规边界约束。 模型大规模实时抓取企业公开信息,会碰到第一篇讨论的「三阶审查」框架——技术手段是否突破对方技术措施、是否造成实质性负担。合规收紧会直接压缩情景 C 的空间。这一组相互作用是情景 C 「不会完整发生」的五条理由中的第三条。

变量五 × 变量七:口径统一程度决定机器消费的可靠性。 调用方从人变成机器(变量七)之后,口径不统一(变量五)的危害会被放大——机器不会自行判断两个来源的口径不同,它会把它们混在一起用。这意味着需求形态向机器倾斜得越快,口径披露规范化的压力越大。这一组相互作用是「口径文档成为规范」这一判断的来源。

变量四 × 变量七:激励形态与需求形态决定拐点时间。 如果需求侧的调用量快速上升(变量七),商业底座即便没有政策激励(变量四缺位)也能靠市场收入跑通;如果调用量上升缓慢,政策激励就成了底座能否撑到拐点的关键。两者的组合决定情景 B 的拐点是 2028 年还是更晚。

把六组相互作用合起来,可以画出一张简化的因果图:

  • 变量一、二是速度轴,决定一切变化来得多快;
  • 变量三、四是方向轴,决定 A 与 B 的分野;
  • 变量五、六是约束轴,决定每个情景能走多远;
  • 变量七是规模轴,决定市场有多大。

三个情景就是速度轴、方向轴、约束轴的不同组合在规模轴上的投影。下一部把它们逐一展开。

第三部 三个情景

三个情景由第二部的三个决定性变量组合而成:模型能否自己查(变量一)、公共数据开放的深度(变量三)、加工激励的形态(变量四)。每个情景按同样的五段写:机制、时间线、先行信号、赢家与输家、证伪条件与风险。

三个情景的名字分别是:公共底座、运营底座、模型直采。 它们不是互斥的——第四部会讨论最可能出现的分层组合——但先把每一个推到它自身逻辑的尽头,才能看清各自的边界。

十七、情景 A「公共底座」:机制

触发条件:变量三走向高开放:政府内部多部门数据的汇聚(「一本账」)以「企业经营活性画像」这类公共数据产品的形式,通过授权运营向市场提供;变量四的激励形态是「政府建底座、市场做应用」;变量一处于中等水平,模型能做单点查询但不能做全量加工。

机制的核心,是一个此前从未向市场开放过的信息源:政府各部门各自掌握的企业经营痕迹。

税务部门知道一家企业每个月开了多少发票、缴了多少税;社保部门知道它给多少人缴了社保、人数在增还是在减;电力部门知道它的用电量与负荷曲线;海关知道它有没有报关、报了什么;环保部门知道它的环保合规记录、是否在正常运行;应急部门知道它的安全生产检查记录;市场监管部门知道它的登记与年报。

这些数据各自都是部门内部信息,彼此不通。但只要把其中三四个连在一起——比如用电量、社保人数、开票额——就能以远高于任何商业推断的准确度回答第一篇反复讨论的那个问题:这家企业是不是真的在生产、规模多大、现在还在不在。 一家用电量连续六个月为零、社保人数为零、无开票记录的「存续」企业,不需要任何多源硬信号交叉验证,它就是停业了。

「十五五」纲要提出的「建立全国数据资源『一本账』」,就是这些数据在政府内部汇聚的制度动作。情景 A 的分叉点在于:汇聚之后,会不会以某种脱敏、聚合、授权的形式向市场开放。

开放的制度通道已经存在。2025 年 1 月的公共数据资源授权运营三份文件规定了登记、运营规范和价格形成机制;价格文件明确「用于产业发展、行业发展的,可收取公共数据运营服务费」,收费形式可以是「数据调用量」;准许利润率按 10 年期国债平均收益率加不超过 6 个百分点核定。也就是说,一个省级授权运营机构,把税务、社保、用电三个部门的数据加工成「企业经营活性指数」,按调用量向市场收费——这件事在 2026 年的制度框架下已经是可以做的。

在情景 A 里,这件事从「可以做」变成「普遍做」。到 2030 年前后,主要省份的授权运营目录中都出现了企业经营活性类产品,价格受准许收益约束,更新频率按月或按季,通过标准接口(包括 MCP)向市场提供。

在这个情景下,产业数据的分层结构发生了根本变化:

  • 公共层回答「是否在经营、规模多大、是否正常」——由授权运营机构基于多部门数据提供,准确度高,价格受管制;
  • 市场层回答「在造什么、工艺如何、产业带归属、谁能拍板」——这些产业属性仍不在任何政府部门的采集范围内,仍需商业加工;
  • 应用层把两层数据组合成面向具体场景的产品——销售线索、供应商筛选、授信辅助。

商业加工者今天做的工作里,「从公开痕迹推断企业是否在生产」这一大块,在情景 A 里被更准确、更便宜的公共产品替代。留给市场的是产业属性这一层——恰好是第一篇说的「登记信息之外的无人区」。

十八、情景 A:时间线

情景 A 的时间线由「十五五」的政策节奏决定。

2026—2027:汇聚期。 「一本账」进入部门级实施方案。各省公共数据授权运营机构完成登记,运营目录以政务便民、金融风控类产品为主。少数省份试点「企业经营活性」类产品,服务对象主要是本省银行的普惠信贷。「数据要素×」三年行动计划于 2026 年底收官,300 个典型应用场景中出现基于多部门企业数据的工业制造场景。

2028:定型期。 可信数据空间建成 100 个以上的目标到期,其中出现若干省级或行业级的「企业数据空间」,把授权运营的企业活性产品与行业协会、产业链龙头的数据放进同一个空间。行业高质量数据集建设行动同年到期,工业领域数据集建设的经验——标准、质检、基准验证——被借用到企业活性产品的质量管理上。准许收费标准陆续公布,企业活性类产品的调用价格有了官方参照。

2029—2030:铺开期。 全国一体化数据市场的框架下,企业活性产品跨省互认——一个浙江的买方可以调用广东的授权运营产品,口径一致、价格可比。商业数据机构大规模接入公共层,把自己的「是否在生产」判定切换为公共产品的结果,把加工投入集中到产业属性层。

2031:新分层稳定。 「公共层给经营状态、市场层给产业属性、应用层做场景」的结构成为常态。

这条时间线里最关键的节点是 2028 年:可信数据空间和高质量数据集两个行动同时到期,它们的成果形态决定了公共层会不会真正向市场开放。

十九、情景 A:先行信号

如果情景 A 正在发生,最早会看到的信号是这些:

信号 A1:省级授权运营目录中出现企业活性类产品。 具体表现为:产品名称含「经营状态」「活跃度」「经营画像」等,数据来源注明税务、社保、电力中的两个以上,服务对象不限于金融机构。这是最直接的信号,2027 年之前出现即为强信号。

信号 A2:准许收费标准的公布。 某省发展改革部门会同数据管理部门公布企业类公共数据产品的上限收费标准,且按调用量计价。这意味着公共层的定价机制已经从文件走到执行。

信号 A3:「一本账」的实施方案进入部门层面。 国家数据局或省级数据局发布「一本账」的建设方案,明确纳入税务、社保、电力等部门数据。

信号 A4:公共数据产品支持标准接口。 授权运营产品提供 MCP 或等价的机器可调用接口,而不只是人机界面或批量交付。这是判断公共层能否被模型与应用直接消费的关键。

信号 A5:商业数据机构开始接入公共层。 主要商业数据平台宣布接入某省授权运营的企业活性产品,作为自身判定的输入。

五个信号中,A1 和 A4 是必要信号——没有它们,情景 A 就不成立;A2、A3、A5 是加速信号。

二十、情景 A:赢家与输家

赢家:

买方。 三类需求方——向工厂销售的、寻找工厂的、接入数据的——都会受益:「是否在生产」这个最基础的判断,准确度从商业推断的水平提升到多部门数据的水平,价格受准许收益约束,比市场化定价低。

应用层开发者。 公共层与市场层的接口都标准化之后,做场景应用的门槛降低。一个做县域产业招商工具的团队,不需要自建工厂判定能力,直接调用公共层的经营状态和市场层的产业属性。

授权运营机构。 它们获得了一个新的、需求刚性的产品线,且有制度保障的回报率。

做产业属性的加工者。 「在造什么」「产业带」「决策人」这些字段不在公共层,商业加工者可以把资源集中到这里,不必再分散精力做经营状态推断。

输家:

以「经营状态推断」为核心壁垒的商业加工者。 如果一家机构的主要价值在于「我能从公开痕迹判断这家企业还活着」,那么公共层会以更高的准确度和更低的价格替代它。它必须向产业属性层迁移,否则出局。

依赖信息不对称的中间服务。 部分验厂、尽调、信用报告业务中「确认企业是否正常经营」的部分,会被公共层直接回答。

需要说明一个边界:情景 A 的公共层解决的是「经营状态」,不是「产业属性」。它不会回答一家企业在造什么、能不能做医疗级注塑、产业带归属在哪里。这些问题的信息不在任何政府部门手里,公共层做不了。因此情景 A 不会消灭商业加工,它会改变商业加工的重心。

二十一、情景 A:证伪条件与风险

证伪条件:以下任一情况出现,情景 A 在五年窗口内关闭:

  • 到 2028 年底,没有任何省级授权运营目录出现基于两个以上部门数据的企业经营活性类产品;
  • 「一本账」的实施停留在政务内部共享,公开文件中明确排除向市场提供企业级数据产品;
  • 授权运营的企业类产品以「批量交付」为主要形式,不提供按调用量的接口——这说明它无法被模型与应用消费,公共层不成立。

风险:即便情景 A 发生,它自身有四个内在风险:

更新频率。 公共数据产品的更新节奏受制于各部门的数据周期——税务按月、社保按月或按季、用电按月。对「是否在生产」这个问题,月级更新是够的;但情景 A 的公共层无法回答周级或天级的变化。

口径的稳定性。 公共产品的口径由运营机构定义,而各省的运营机构各自定义,跨省互认需要口径统一。变量五讨论过,这件事很难。情景 A 的铺开期能否到来,很大程度上取决于口径互认能否实现。

商业秘密与个人信息边界。 税务、社保、用电数据在企业层面聚合后,仍可能泄露商业秘密(用电曲线反映产能利用率),涉及个人信息(社保人数变动反映裁员)。公共层产品必须经过脱敏与聚合,而脱敏的粒度直接决定它的可用性。这是一条很难走的平衡线。

运营机构的动力。 准公用事业定价意味着回报率受限。一个回报率被限定在国债收益率加六个百分点以内的机构,有没有动力持续迭代产品、扩展接口、响应市场需求?公用事业的历史经验是:有动力维持,缺动力创新。情景 A 的公共层可能会稳定但迟钝。

这四个风险合起来,指向一个判断:情景 A 即便发生,公共层也更可能是一个「稳定的底」而不是「活跃的面」。 它给市场一个可靠的基准,但市场的活力仍然来自基准之上的加工与应用。

二十二、情景 B「运营底座」:机制

触发条件:变量三保持低开放:公共数据继续以合规信息为主,多部门经营数据的汇聚停留在政务内部;变量四的激励要么缺位,要么以补贴或采购市场化底座的形式出现;变量一处于中等水平,模型能做单点查询,不能做全量加工与持续核验。

机制的核心,是运营积累形成的不可替代性。

在这个情景里,产业属性层与经营状态层都没有公共产品,全部由商业加工者提供。几百万家主体、每年至少三分之一的记录需要核验、字段以月为单位失效——这些工作量的绝对值是确定的(基线二),能持续承担它的机构不会多。

第一篇讨论过产业数据的成本结构:固定成本极高,边际成本低但不为零,正外部性强。这种结构的自然结果是集中——投入不足的参与者摊不平固定成本,退出;持续投入的参与者存量越滚越大,核验体系越来越成熟,单位成本越来越低。五年之后,市场会出现少数几家「运营底座」,它们不是靠采集能力,而是靠持续核验的时间积累,成为大多数应用和模型的默认数据源。

第二篇讲邓白氏时总结的三条经验在这里全部生效:护城河来自持续核验而不是一次性采集;标识符之上的加工层是价值所在;行业的自然形态是长周期、低增速、高壁垒。

这个情景下的交付形态是接口调用。 调用方是智能体与应用,不是人。按次计费——第一篇引用的公开价格量级在每次 0.1 元到 0.25 元——把加工的固定成本摊到海量调用上。调用量的增长来自智能体的普及:2027 年智能体普及率超过 70% 的目标一旦接近,每一个面向制造业的智能体都需要一个外部产业主体数据源,而它们不会各自去建。

事实标准会以「口径文档」的形式出现。 在没有国家标准的条件下,变量五讨论的口径统一走第二条路径:某家或某几家运营底座公开自己的判定规则——什么算工厂、什么算有外贸业务、什么算决策人联系方式——这些规则被应用开发者、研究机构、甚至监管部门引用,成为事实上的参照。不是因为它们被指定,而是因为它们最早把规则写清楚了。

联系方式字段在这个情景下形成行业规范。 合规(变量六)在个人信息上收紧,运营底座为了长期经营,会主动把「脱敏存储、按权限解锁、逐笔审计、异议可删」做成标准配置,并且把它作为与低质供给区分的标志。海外的《删除法》类监管,会促使面向境外市场的底座在联系方式字段上采取更保守的策略——只提供企业级联系方式,个人级联系方式仅在国内合规框架内提供。

二十三、情景 B:时间线

2026—2027:接入期。 面向制造业的智能体开始批量上线,其中相当部分需要外部产业主体数据。运营底座通过 MCP 和 REST 接口成为这些智能体的数据源。接口调用量开始超过人工查询量。数据商培育办法出台,可能以补贴或政府采购形式支持通用底座建设——但即便没有,市场化的调用收入已经开始覆盖部分固定成本。

2028:拐点期。 智能体普及率接近 2027 年目标,调用量出现数量级跃升。按次单价稳定或小幅下降,总收入增长。头部运营底座开始披露口径文档,应用开发者按口径文档选择数据源。浅层查询类产品(「查一家企业的基本情况」)被模型的实时能力替代,价格迅速下降,市场分化为「模型自己能查的」和「必须调底座的」。

2029—2030:集中期。 市场形成两到三家通用运营底座加若干垂直加工者(按行业或按字段专精)的格局。集中度上升引发对定价与准入的关注,可能出现针对数据底座的公平竞争审查。跨境数据身份产品出现——面向境外买家的、可核验的中国工厂画像,作为运营底座的延伸产品。

2031:事实标准期。 头部底座的口径文档成为行业参照,跨机构口径互认在部分字段上实现。数据资产入表规则可能出现针对持续核验投入的资本化路径——这是情景 B 里加工投入第一次在报表上被看见。

这条时间线里最关键的节点是 2028 年的调用量拐点:它决定按次分摊模式能否真正跑通。如果拐点没有出现,运营底座会长期依赖交叉补贴,集中度上升的逻辑就不成立。

二十四、情景 B:先行信号

信号 B1:主流模型客户端内置的产业数据源。 主要的智能体开发框架或模型客户端,在其工具目录中出现「企业信息」「工厂检索」类数据源,且引用的是商业底座而不是公共产品。这是最直接的信号。

信号 B2:按次调用价格的稳定。 商业底座的按次价格在两年内保持稳定或上涨,而不是陷入价格战。价格战意味着同质化竞争、无差异化壁垒;价格稳定意味着运营积累形成了不可替代性。

信号 B3:口径文档的公开。 至少一家商业底座公开其完整的判定规则文档——什么算工厂、判定依据是哪些信号、置信度如何分级——并被第三方引用。

信号 B4:数据商培育办法落地且覆盖通用底座。 国家或省级出台数据商培育的具体办法,其中有针对「通用产业数据底座」的支持条款(补贴、采购、资质、税收之一)。这不是必要信号,但是加速信号。

信号 B5:调用量的披露。 商业底座开始披露接口调用量,且年增速在一个数量级以上。

信号 B6:跨境数据身份产品的出现。 面向境外买家的中国工厂画像产品上线,且获得海外采购方或合规机构的采用。

六个信号中,B1、B2、B5 是必要信号;B3、B4、B6 是加速信号。

二十五、情景 B:赢家与输家

赢家:

持续投入核验的加工者。 这是情景 B 最直接的赢家。它们的存量、核验体系、口径文档在五年内变成不可替代的资产。

应用开发者。 有了稳定的底座,做场景应用的门槛降低——与情景 A 类似,只是底座是商业的而不是公共的。

买方(中期)。 调用量上升摊薄单价,买方获得的数据比今天更准、更便宜。但长期看,集中度上升可能带来定价权的转移,买方在 2030 年之后的议价能力会下降。

输家:

浅层查询类产品。 「查一家企业的基本情况」这类需求,五年内会被模型的实时能力基本替代。只做这一层的工具,要么向下沉到底座、要么向上做应用,停在中间会被两头挤压。

不做口径披露的低质供给。 当头部底座公开口径文档之后,「准确率 98%」这类无依据的宣称会失去市场。不能说明自己怎么算的供给者会被应用开发者排除在数据源之外。

投入不足的加工者。 高固定成本的结构下,投入不足意味着覆盖不全、核验不及时、口径不清,在集中期被淘汰。

一个需要如实写出的观察:情景 B 对现有的市场化加工者最有利,而本文作者所属的平台正是其中之一。 天下工厂产业平台在 2026 年的形态——多源信号判定、口径披露、按次调用、失败不计费、脱敏与审计——与情景 B 描述的运营底座高度一致。这不是巧合,而是因为本文对情景 B 的推演,很大程度上参考了这类机构已经在做的事。读者应当把这一点纳入对本节判断的折扣。

二十六、情景 B:证伪条件与风险

证伪条件:

  • 到 2029 年,商业底座的接口调用量没有出现数量级跃升,人工查询仍是主要形态;
  • 头部商业底座持续依赖母公司或其他业务的交叉补贴,按次收入未能覆盖固定成本;
  • 按次调用价格在两年内下降超过一半,说明同质化竞争而非差异化壁垒;
  • 情景 A 的必要信号(公共层企业活性产品)在 2028 年前出现——那意味着经营状态层被公共产品占据,情景 B 的运营底座只能在产业属性层生存,规模会小得多。

风险:

集中度与监管。 两到三家底座成为大多数应用的默认数据源,会引发公平竞争审查。第一篇讨论过 2026 年 2 月四部门意见对交易所的「严控数量」,同样的逻辑可能延伸到数据商。运营底座需要在事实标准与垄断嫌疑之间走一条很窄的线——公开口径、开放接口、价格透明,是唯一的走法。

正外部性导致的长期投入不足。 第一篇第 34 章的核心论点在情景 B 里不会消失:加工的社会收益远大于加工者能收取的费用。即便调用量拐点出现,底座的投入仍可能低于社会最优水平。这不是某家机构的问题,是结构问题。

合规事故。 联系方式字段是情景 B 的高价值字段,也是高风险字段。任何一家头部底座出现严重的个人信息事故,整个字段的合法性会被重新审视——第一篇把合规投入称为「期权」,情景 B 里这个期权的价格会持续上涨。

模型能力的意外跃升。 这是情景 B 最大的外部风险,也就是情景 C。如果变量一在五年内走到高位,情景 B 的浅层部分会被吞掉,深层部分(持续核验、口径、审计)虽然保留,但市场规模会显著缩小。

二十七、情景 C「模型直采」:机制

触发条件:变量一走到高位:模型智能体能在单次任务中稳定扫描数百到数千个网页、做交叉验证、给出一致的判断;变量二的推理成本降到足以支撑这种任务的水平;变量三与变量四的状态在此情景下不再重要——公共底座和商业底座都被绕过了。

这是对现有数据加工者最不利的情景,本文给它与另外两个情景同等的篇幅。

机制的核心,是加工从「预先做好」变成「用时现做」。

在情景 A 和 B 里,数据加工是一个前置过程:有人把几百万家企业的公开痕迹提前读一遍、判定一遍、结构化一遍、持续核验,然后以接口的形式等着被调用。在情景 C 里,这个前置过程被取消——当一个用户问「华东有哪些能做医疗级注塑的厂」时,模型智能体当场去搜、去读、去判断、去核对,然后给出答案。

这条路径的逻辑基础是:如果模型足够强、成本足够低,为什么要预先加工几百万条大多数永远不会被查的记录? 只加工被问到的那一部分,成本更低,信息更新——因为它是此刻抓取的,不是三个月前核验的。

推动这条路径的三个技术趋势,在 2026 年都已经可见:模型的上下文长度在扩展,工具调用的并行度在提升,推理成本两年降了 280 倍。把三条曲线外推五年,「单次任务扫描上千网页」在算力上不是问题。

在情景 C 里,专门的产业数据底座被三种东西吸收:

  • 模型厂商的内置能力。 模型厂商把「企业信息检索与判定」做成模型自带的工具,用户不需要接入任何第三方数据源。
  • 搜索引擎的升级。 搜索引擎从「返回网页列表」升级为「返回结构化的企业画像」,它本来就有全网抓取的基础设施。
  • 应用自己的实时抓取。 应用开发者在自己的智能体里内置抓取与判定逻辑,按需调用,不依赖外部底座。

留给专门加工者的,是模型实时做不到的那部分:需要真实交互才能确认的信息(这个电话今天还通不通、这家厂上周有没有发货)、需要长期积累才能形成的信息(时序快照、历史变更、产业带的形成与衰退)、以及需要承担责任的信息(有审计记录、可追溯、可问责的数据)。

二十八、情景 C:时间线

2027:单点替代。 「查一家企业的基本情况」类需求,模型实时检索的答案质量达到可用水平,用户不再为这类查询付费。浅层查询工具的收入开始下降。

2028—2029:中等任务替代。 「找一批符合条件的企业」类需求,模型智能体能在几分钟内扫描几百个来源给出候选名单,准确度接近商业底座的初筛水平。买方在「便宜但要自己核」和「贵一点但已核过」之间开始分化。

2030:底座价值收缩。 预加工底座的价值集中在三件事上:持续核验、时序积累、审计责任。「覆盖」不再是壁垒——模型也能覆盖;「判定」不再是壁垒——模型也能判定;壁垒只剩下「我核过、我有历史、我负责」。底座的市场规模显著缩小,但不归零。

2031:分工稳定。 模型做实时的、浅层的、一次性的;底座做持续的、深层的、可追溯的。两者的边界由「这个信息能不能靠实时抓取可靠地得到」划定。

这条时间线里最关键的节点是 2028 年模型在「找一批」任务上的表现。如果模型能在这一年稳定完成中等复杂度的全量筛选任务,情景 C 的主体部分就成立了。

二十九、情景 C:先行信号

信号 C1:模型单次任务可读网页量的跃升。 主流模型客户端在单次任务中稳定读取的网页数量从数十跃升到数百甚至上千,且结果一致性可接受。这是必要信号中的必要信号。

信号 C2:实时检索的使用占比与满意度上升。 模型客户端中,用户对企业类问题选择「实时检索」而非「调用数据源」的比例上升,且满意度不低于数据源模式。

信号 C3:模型厂商推出企业信息类内置工具。 主要模型厂商在其工具目录中提供「企业检索与判定」的内置能力,不依赖第三方数据源。

信号 C4:浅层查询产品的调用量下降。 商业数据平台披露的「单家企业查询」类调用量出现明显下降,而「全量筛选」类调用量持平或上升——说明浅层被替代、深层未被替代。

信号 C5:抓取合规判例对模型实时抓取的态度。 法院或监管对「模型智能体大规模实时抓取企业公开信息」的态度:如果被认定为合理使用,情景 C 加速;如果被纳入「三阶审查」并受到限制,情景 C 减速。

五个信号中,C1 是必要信号;C2、C3 是加速信号;C4 是确认信号;C5 是边界信号。

三十、情景 C:赢家与输家

赢家:

模型厂商。 企业信息成为模型内置能力的一部分,模型的使用价值上升,第三方数据源的议价能力下降。

终端用户(短期)。 浅层查询免费化,中等任务的成本大幅下降。用户不需要理解「数据源」这个概念,问就行。

应用开发者(部分)。 不需要接入外部底座的开发者,开发成本下降。但需要可靠数据的开发者,会发现实时抓取的一致性问题。

输家:

浅层数据产品。 这是情景 C 的直接输家,且在三个情景中都是输家——它们在情景 A 里被公共层替代,在情景 B 里被底座挤压,在情景 C 里被模型吞掉。

以覆盖和判定为壁垒的加工者。 如果一家机构的核心竞争力是「我覆盖得全」「我判得准」,情景 C 里这两条都会被模型部分复制。它必须转向「我核验过」「我有历史」「我负责」。

终端用户(长期)。 这是一个反直觉的判断。实时抓取的信息没有审计记录、没有一致性保证、没有责任主体。第一篇第 24 章讨论过,错误数据经过模型不会被稀释,只会被放大——它会以流畅、自信的语言输出一条错误的联系方式或者一家不存在的供应商。当用户依据这样的答案做出采购决策并受损时,没有人对这条信息负责。短期的便宜,可能以长期的不可靠为代价。

三十一、情景 C:为什么本文认为它不会完整发生

本文推演情景 C 到它逻辑的尽头,但本文的判断是:五年内它会部分发生,不会完整发生。 理由有五条,每一条都能被检验。

理由一:一致性。 实时抓取的结果依赖搜索引擎的排序、网页的可达性、模型的采样,同一个问题两次得到不同的答案是常态。对于「查一家」这种一次性任务,不一致可以容忍;对于「找一批并持续跟踪」这种任务,不一致意味着每次都要重新核对,效率反而低于调用一个稳定的底座。

理由二:成本的量级差。 一次调用预加工接口的成本是 0.1 元量级(基线六);一次扫描上千网页并做交叉验证的任务,即便推理成本再降一个数量级,token 消耗仍在百万量级,成本在元到十元量级。对高频调用场景(一个智能体每天为几百个用户各做一次筛选),实时抓取的总成本比调用底座高一到两个数量级。变量二的下降会缩小这个差距,但五年内缩不到可以忽略的程度。

理由三:反爬与合规。 模型大规模实时抓取企业网站、招聘平台、招投标网站,会触发目标站点的反爬机制和第一篇讨论的「三阶审查」框架——技术手段是否突破了对方的技术措施、是否对对方服务器造成实质性负担。预加工底座的抓取是低频、分散、可控的;模型驱动的实时抓取是高频、集中、随需求爆发的。后者在合规上的处境更脆弱。

理由四:核验无法实时完成。 「这家企业是不是还在生产」,最可靠的判断依据是连续几个月的招聘、中标、社保变化——这是时序信息,需要提前积累,实时抓取拿不到过去的快照。第一篇第 38 章的判断在这里生效:时间维度的信息,只能靠提前开始。

理由五:责任。 采购决策、授信决策需要可追溯的依据。「模型说的」不能作为依据,「某数据源在某时点的记录」可以。只要决策需要问责,就需要有一个可以被问责的数据源。

五条理由的共同点是:它们都指向情景 C 的边界,而不是否定情景 C 的方向。浅层查询会被模型吃掉,这几乎是确定的;深层的持续核验、时序积累、审计责任,五年内模型替代不了。

证伪条件:以下任一情况出现,本文对情景 C 的「不会完整发生」判断被推翻:

  • 到 2029 年,主流模型在「找出全国所有符合某组产业条件的企业」这类全量筛选任务上,准确率与一致性达到商业底座的水平,且单次任务成本降到与接口调用同一量级;
  • 模型厂商建立了自己的持续核验体系——即模型厂商本身变成了运营底座,从而把情景 B 的赢家换成了自己。

第二条值得单独说:它意味着情景 C 的终局可能不是「加工层消失」,而是「加工层被模型厂商内化」。那样的话,第一公里没有消失,只是换了承担者。

三十二、第四个情景「停滞」:如果什么都没有发生

三个情景都假设某个变量走到了足以触发分叉的位置。还有一种可能是三个变量都停在中间:公共数据没有开放到企业活性层,商业底座没有等到调用量拐点,模型没有跨过可读网页量的阈值。这就是证伪条件里的第一条——本文把它作为第四个情景单独推演,因为「什么都没发生」也是一种需要提前看见的未来。

机制。 停滞不是没有变化,而是变化没有累积成分叉。政策继续出台但停留在原则层面,数据商有分类没有培育办法,公共数据授权运营继续以政务与金融风控产品为主,「一本账」停在政务内部共享。商业底座继续投入,但调用量增长缓慢,按次收入长期不足以覆盖固定成本,依赖交叉补贴维持。模型的实时检索能力提升到能稳定读几十到上百个网页,能替代浅层查询,但在全量筛选任务上一致性不足,用户仍然需要底座,只是不愿意为它多付钱。

形态。 到 2031 年,工厂数据的形态与 2026 年基本相同:公共层给合规信息,商业层给产业属性但覆盖与核验不足,模型做浅层查询。第一篇描述的「缝隙」原封不动——通用产业数据加工仍然落在四条买单路径之间,没有人被明确指定去完成它。

先行信号。 停滞的信号是「其他情景的必要信号连续两年不出现」:2027 年底,省级授权运营目录仍无企业活性产品;主流模型客户端仍无内置的商业产业数据源;商业底座仍未披露调用量;模型可读网页量仍在数十量级。四条同时成立,停滞情景的可能性显著上升。

谁承担代价。 停滞的代价不是均匀分布的。买方承担最多——采购、金融、销售继续在信息不对称里做决策,供应链风险继续靠人工排查;商业加工者承担第二多——垫付期无限延长,一部分退出,剩下的降低核验频率以压缩成本,数据质量下滑;政策目标受影响——1000 个工业智能体如果没有可靠的外部数据源,能做的只有企业内部优化,供应链协同类的智能体做不出来。

停滞为什么可能。 三个原因。其一,第一篇第 34 章的经济学:加工的正外部性无法被加工者捕获,市场会系统性投入不足,而制度激励到 2026 年仍是原则性的。其二,公共数据开放的每一步都要处理商业秘密与个人信息的边界,这个边界的争论可能耗掉整个五年。其三,模型能力的提升如果恰好停在「够替代浅层、不够替代深层」的区间,它会削弱底座的浅层收入,又不能替代底座,结果是底座更难活、用户更不满意——两头不讨好。

停滞为什么不太可能。 也是三个原因。其一,智能体的政策目标已经写进文件,1000 个工业智能体要落地,主管部门会发现外部数据源是瓶颈,从而推动激励细化。其二,跨境需求是刚性的——境外买家的合规要求不会因为国内市场停滞而放松,「出海的数据身份」会倒逼底座建设。其三,五年是一个足够长的时间,三个变量中至少有一个走到分叉位置的概率,高于三个都停在中间的概率。

本文把停滞列为第四个情景,不是因为它最可能,而是因为它最容易被忽略。情景分析的一个常见失误是只推演「会发生什么」,不推演「如果都没发生会怎样」。后者往往才是决策者真正需要提前准备的——因为它不需要任何人做任何事就会到来。

证伪条件。 停滞情景被证伪的条件与另外三个情景相反:三个情景中任何一个的必要信号在 2028 年前出现,停滞情景即告关闭。

第四部 八个字段的命运

第一篇把工厂数据拆成八个字段:名字、身份、分类、规模、产能、人、位置、时间。三个情景对这八个字段的影响并不均匀——有的字段在三个情景下命运相同,有的字段正是情景之间分歧的所在。本部逐字段推演。

三十三、名字:三个情景下都不再是问题

「名字」这一格的难点,第一篇讲得很清楚:同一家企业在不同来源里有十几种写法,字号重名极多,名称会变,主体与厂区不是一对一。解决它的方法是实体对齐——用代码、规则、多特征联合判定把变体归到同一主体。

三个情景对这一格的影响是一致的:它会从「难题」降级为「工序」。

在情景 A 里,公共层的企业活性产品以统一社会信用代码为主键,任何接入公共层的应用都天然获得了一个对齐锚点。在情景 B 里,运营底座的核心资产之一就是多年积累的名称变体库——哪个简称对应哪家企业、哪个曾用名迁移到了哪个现名——这个库随存量增长而增长,对齐的准确率持续提升。在情景 C 里,模型本身在名称归一上的能力已经相当强:给它「苏州华鼎精密机械」和「华鼎精机」,它能判断出这大概率是同一家,且能说出理由。

三个情景共同指向的结论是:五年后,名字不再是产业数据的瓶颈。 它仍然需要处理,但处理它的方法已经成熟、成本已经可控,不再是区分优劣的维度。

唯一的例外是历史对齐——第二篇讲的三线企业「代号—现名」那类跨越几十年的更名链。这类对齐需要史料考证,模型帮不上太多,公共层也不会覆盖。它会留给专门的产业史研究者,不进入主流的数据产品。

三十四、身份:公共层的天下

「身份」这一格由统一社会信用代码解决了唯一性,但没有解决「这个主体现在是什么状态」——法律状态与经营状态之间的偏差,以及一址多照、注册地与生产地分离这类边界问题。

这一格是三个情景中差异最大的一格,因为它正是情景 A 的核心。

情景 A:公共层直接回答。 税务、社保、用电三个部门的数据汇聚之后,「这家企业是否在正常经营」的判断准确度远高于任何商业推断。法律状态与经营状态的偏差,在公共层被消除。这是情景 A 对产业数据最大的贡献,也是它对商业加工者最大的替代。

情景 B:商业底座用多源信号逼近。 没有公共层,运营底座只能用招聘、中标、专利、官网存活、年报社保人数这些公开信号交叉推断经营状态。准确率可以做到相当高,但永远达不到多部门数据的水平——因为最硬的信号(用电、开票)它拿不到。这是情景 B 的天花板,也是情景 A 一旦出现就会替代它的原因。

情景 C:模型实时推断,一致性差。 模型可以当场抓取一家企业的官网、招聘、新闻,判断它是否还在经营。对单家企业这足够了;对几万家企业的批量判断,实时抓取的一致性和成本都不如预加工。

从这一格可以得出一个对全文都重要的判断:「身份」是三个情景的分水岭。 公共层如果开放,它就是公共品;如果不开放,它就是商业底座的核心壁垒;模型在任何情况下都只能做单点补充。第六部的分叉点分析会回到这里。

三十五、分类:口径之争的主战场

「分类」这一格的问题是粒度:国民经济行业分类小类 1382 个装不下几百万家工厂的实际产品,经营范围又高召回低精度。商业加工者各自重建了面向应用的类目体系——天下工厂平台的 1965 个细分类目是一例——但各家体系互不相通。

三个情景对这一格的影响,取决于变量五(口径统一)的走向,而这个变量的不确定度很高。

情景 A:公共层不碰分类。 政府部门没有产业属性的采集,公共层不会给出「在造什么」的分类。分类仍由市场层提供,口径仍然各自定义。情景 A 对这一格几乎没有影响。

情景 B:事实标准的可能性最大。 运营底座公开口径文档之后,它的类目体系会被应用开发者、研究机构引用,逐渐成为事实上的参照。但「事实标准」不等于「统一」——头部底座可能有两三家,各自的类目体系互有差异,互认只在部分品类上实现。

情景 C:分类由模型即时生成,不再需要预设体系。 这是情景 C 对这一格最有意思的影响。模型不需要一个预先定义好的类目树,它可以根据用户的描述当场判断哪些企业符合——「能做医疗级注塑」不需要是一个类目,它是一个语义条件。分类体系在情景 C 里从「必需品」变成「可选项」。

但情景 C 的这一优势有代价:没有预设体系,就没有可比性。今天问「能做医疗级注塑的厂」得到 300 家,明天换一种问法得到 500 家,没有人能说清楚差异来自哪里。第一篇说的伪精度问题在情景 C 里会以新的形式出现——不是数字精确到个位,而是每次问都得到一个精确的、但彼此不可比的数字。

这一格的推演结论是:五年内不会有统一的产业分类口径;最可能的形态是「口径披露成为规范」——每家必须说清自己怎么分的,而不是大家分得一样。

三十六、规模:注册资本退场,社保人数上位,用电量登场

「规模」这一格今天靠两个字段:注册资本(信号价值经三次改写)和社保参保人数(最可靠但有盲区)。

三个情景下,这一格的信息来源会发生结构性变化:

注册资本继续退场。 2024 年新公司法的五年缴足规定部分恢复了它的信号价值,但只对新成立企业有效,且认缴与实缴仍需分别查看。五年内它会退化为一个辅助的分档字段,不再作为主要判断依据。三个情景在这一点上一致。

社保人数在情景 B 和 C 里仍是主字段。 它来自年报公示,公开可得,是没有公共层时最接近真实用工规模的字段。但它的三个盲区——缺失、口径不匹配、滞后——在情景 B 和 C 里都无法消除。

用电量在情景 A 里登场。 如果公共层开放,用电量会成为规模判断的最强字段:它反映的是实际生产活动的强度,不受劳务外包影响,按月更新。一家社保人数 50 人但月用电量相当于 500 人规模工厂的企业,用电量比社保人数更接近真相。情景 A 的公共层如果包含用电数据,「规模」这一格的准确度会有一次质的提升。

产能代理变量的变化。 第一篇说产能只能靠代理变量推断——厂房面积、设备数量、用工、用电、产值区间——可得性都不理想。情景 A 补上了用电;情景 B 靠积累时序(社保人数的变化趋势比绝对值更有信息量);情景 C 靠实时抓取官网和招聘里的产能描述,但那是自报信息,可信度有限。

结论:「规模」这一格在情景 A 下会显著改善,在情景 B 和 C 下维持现状。 它是情景 A 的第二个核心贡献。

三十七、产能:市场层的核心资产

「产能」——这家工厂在造什么、能做什么工艺、有什么认证——是八个字段里公共层最不可能覆盖的一格,因为没有任何政府部门采集产品与工艺信息。

三个情景下,它都留在市场层,但形态不同。

情景 A:市场层的重心。 经营状态被公共层拿走之后,商业加工者的全部价值集中到产能这一格。「能做五轴加工」「有医疗器械生产许可」「通过 IATF 16949」这类可核验的能力标签,是情景 A 下商业加工者的核心产品。

情景 B:运营底座的差异化所在。 经营状态和产能都由底座提供,但经营状态各家做得差不多(都用同一批公开信号),产能才是拉开差距的地方——谁的产品词库更全、同义归一更准、能力标签更可核验,谁的底座更值钱。

情景 C:模型的强项,也是模型的弱项。 模型读产品页、招聘信息、专利文本抽取能力标签,这是它的强项——第一篇说的「语义墙被凿开」正是指这里。但模型只能读到企业自己说的,没法核验企业说的是不是真的。「我们具备五轴加工能力」这句话,官网上写着不等于车间里有。情景 C 下的产能信息是高召回、低精度的——与经营范围的问题同构。

这一格的推演结论是:产能是三个情景下市场层唯一稳固的阵地。 它不会被公共层替代(没有数据源),不会被模型完全替代(模型能读不能核)。五年后产业数据的商业竞争,会集中在这一格。

三十八、人:合规决定形态

「人」——谁能拍板、怎么联系——是商业价值最高、也是合规最敏感的一格。它的命运由变量六(合规收紧的速度与方向)决定,三个情景在这一格上的差异,主要不是来自情景本身,而是来自合规环境。

共同的趋势:企业级联系方式与个人级联系方式分离。 五年内,「企业的采购部电话」和「采购经理张某的手机」会被明确区分。前者是企业公开信息,加工与流通空间开放;后者是个人信息,处理需要合法性基础、脱敏、权限、审计、异议渠道。

情景 A:公共层不碰这一格。 政府部门掌握的法定代表人信息属于登记公示范围,但采购负责人、技术负责人的联系方式不在任何公共数据里。这一格完全留给市场。

情景 B:合规成为底座的准入门槛。 运营底座要长期经营,必须把「脱敏存储、按权限解锁、逐笔审计、异议可删」做成标配。做不到的供给者会因为合规事故退出,或者因为应用开发者不敢接入而失去市场。第一篇把这一格的供给形容为「采集、核验、脱敏、授权、审计这一整套机制的运行结果」——情景 B 下这套机制会成为行业规范。

情景 C:模型实时抓取联系方式,风险最高。 模型当场从招投标文件、展会名录里抓出一个人的手机号并输出给用户——这个行为在合规上的处境比预加工底座更脆弱:没有脱敏、没有权限、没有审计、没有异议渠道。情景 C 在这一格上最可能碰到的不是技术边界,而是法律边界。加州《删除法》对「向第三方提供无直接关系的个人数据」的宽定义、国内《网络数据安全管理条例》对个人信息处理的细化,都会限制模型在这一格上的实时能力。

结论:「人」这一格在五年后仍然是商业产品,但形态会更保守——企业级为主,个人级按权限,且全程可审计。 三个情景的差异在于谁来承担这套机制的成本:情景 B 是底座,情景 C 是模型厂商(如果它们敢做的话),情景 A 是市场层。

三十九、位置:从坐标到产业带

「位置」这一格今天已经相对成熟:注册地址与生产地址的分离可以通过多源信号识别,地理编码的技术成熟,产业带可以通过坐标与品类的联合聚类识别。第一篇提到的 345 万个工厂坐标和 1000 个以上的产业带标注,说明这一格的基础工作在 2026 年已经做到了相当程度。

三个情景对这一格的影响都不大,但有一个方向值得推演:位置的价值会从「点」转向「面」。

「点」是单家企业在哪里;「面」是某个品类的产能在空间上怎么分布、集中在哪几个产业带、产业带在扩张还是收缩。前者是查询,后者是分析。五年内,随着智能体成为主要调用方,「面」的需求会明显上升——一个供应链风险智能体要回答的不是「这家厂在哪」,而是「我的二级供应商是不是都集中在同一个产业带、这个产业带有没有单点风险」。

情景 A 和 B 都能提供「面」的数据,区别在于 A 的公共层可能包含更准确的产能分布(用电量按区域聚合),B 靠自己的坐标与品类数据聚类。情景 C 做「面」的分析最弱——实时抓取几千个网页之后再做空间聚类,成本和一致性都是问题。

这一格还有一个跨境含义:境外买家最关心的位置信息不是精确坐标,而是「这个产业带的配套是否完整、离港口多远、有没有替代产地」。「出海的数据身份」在位置这一格上,需要的是产业带级别的画像。

四十、时间:唯一无法追补的字段

「时间」——数据的保质期、时序快照、历史变更——是第一篇第 38 章重点讨论的那一格:它无法用投入换取,只能用时间换取;今天没有保存的截面,明天花再多钱也买不回来。

这一格在三个情景下的命运,是本部最重要的一段推演。

情景 A:公共层有时序,但不一定开放时序。 税务、社保、用电数据在部门内部天然是时序的——每月一条记录。但授权运营的产品是否会开放历史序列,而不只是当前快照,是一个很大的不确定。如果开放,公共层会成为最完整的企业时序数据源;如果只给快照,「什么时候变的」这个问题公共层仍然答不了。

情景 B:时序是运营底座最深的壁垒。 从 2020 年代初开始按月保存快照的底座,到 2031 年有十年的时序;后来者无论投入多少,都补不上这十年。第二篇讲邓白氏的三条经验,「护城河来自持续核验」在这一格上体现得最直接。情景 B 下,运营底座之间的差距,很大程度上就是时序积累的年数差距。

情景 C:模型没有时序。 实时抓取只能拿到现在的网页,拿不到三年前的网页。模型可以推断趋势,但推断的依据是当前文本里的叙述(「近年来公司规模不断扩大」),不是数据。这是情景 C 最硬的天花板——第三部说情景 C 「不会完整发生」的五条理由里,第四条就是这一格。

三个情景合起来,这一格的结论是:时间维度是五年后区分「底座」与「工具」的标志。 有时序的是底座,没有时序的是工具;底座可以回答「变化」,工具只能回答「状态」。而产业分析中最有价值的问题,几乎都是关于变化的。

对任何一个准备在这五年里做产业数据的机构,本部能给出的最具体的一条建议,与第一篇结尾那条一样:从今天起把每一次采集的结果完整保存下来。 五年后回头看,这会是 2026 年做过的最有价值的一个决定。


八个字段推演完毕。把它们按三个情景下的命运分成三组:

  • 趋于解决、不再区分优劣:名字、位置(点);
  • 公共层与商业层的分水岭:身份、规模;
  • 市场层的稳固阵地:分类(口径)、产能、人(合规形态)、时间(时序)。

第三组是五年后产业数据商业竞争的全部内容。

第五部 三个场景、三种定价、一个跨境

字段是数据的内部结构,场景是数据的外部用途。本部把第一篇讨论的三个落点——向工厂销售、供应链寻源与合规、产业金融与招商——分别放进三个情景里推演,再讨论定价路径与跨境这两个横切问题。

四十一、场景一:向工厂销售

第一篇描述过这个场景的信息需求:有金属加工设备、规模在特定区间、地理位置在覆盖范围内、有可直接联系的采购或生产负责人。四个条件同时满足的名单,是销售效率的杠杆;目前市场能满足前两个,第三和第四个缺口最大。

情景 A 下:前两个条件由公共层与市场层分工解决:规模由公共层(用电、社保)给出,更准;设备与工艺由市场层给出,与今天相同。第四个条件——决策人联系方式——仍在市场层,且合规要求更高。销售获客的整体效率提升,主要来自规模判断的准确度:名单里「看起来是 300 人厂、实际只剩 30 人」这类错误会大幅减少。

情景 B 下:四个条件全部由运营底座提供,通过智能体接口嵌入销售人员的工作流。销售人员不再「查名单」,而是让智能体每天推送符合条件的新增或变化企业——某家厂新招了一批数控操作工,说明它在扩产,正是设备与耗材销售的时机。这个场景的价值从「名单」升级为「信号」,而信号依赖时序,正是情景 B 的强项。

情景 C 下:销售人员直接问模型「找华东做汽车零部件的厂」,模型实时抓取给出候选。初筛的门槛降到零,但名单的有效率下降——实时抓取无法核验联系方式是否有效、企业是否还在经营。销售人员的时间从「找名单」转移到「核名单」,总效率未必提升。这个场景是情景 C 的短板最明显的地方:销售最需要的是有效率,而有效率靠核验,核验靠时间。

三个情景的共同趋势:销售获客从「一次性名单」转向「持续信号」。 智能体每天盯着几万家目标企业的变化,比销售人员每季度买一份名单更有效。这个转变对数据产品的要求是——变化必须被记录,即时间维度必须存在。

四十二、场景二:供应链寻源与合规

这个场景的需求比销售更严格,因为决策后果更重:选错供应商的代价是产线停摆。它还有一个特殊需求——二级供应商的穿透。

情景 A 下:供应商的经营状态由公共层给出,可信度高——一家二级供应商的用电量连续下降、社保人数减半,这是断供风险的早期信号,比任何公开痕迹都硬。产能与资质仍靠市场层。合规审查(CSDDD 类)需要的「活动链」信息,在情景 A 下有了一个可靠的基础层。

情景 B 下:运营底座提供的时序数据是这个场景的核心工具。断供风险的识别本质上是变化检测——哪家供应商的活性信号在衰减;二级穿透本质上是关系图谱——某种材料在全国有哪些生产企业、产能集中在哪几个区域。两者都是底座的积累型能力。

情景 C 下:模型可以实时回答「某种材料有哪些生产企业」,给出一份候选。但「哪家的风险在上升」这个问题,实时抓取答不了——它没有过去的快照可以比较。情景 C 在这个场景下只能做候选发现,做不了风险监测。

三个情景的共同趋势:供应链场景对「变化」的需求,比销售场景更刚性。 因为这个场景要防的是「原来好的变坏了」,不是「找一个好的」。

这个场景还有一个 2026 年已经明确的驱动:欧盟 CSDDD 的链式传导。即便综合法案收窄了直接适用范围,中国供应商仍会被欧盟客户要求提供活动链信息。五年内,「能向境外客户出具一份可核验的供应链画像」会从加分项变成入场券——本部最后一章会回到这里。

四十三、场景三:产业金融与区域招商

县域银行给制造企业授信,需要判断企业是否真在生产、订单是否稳定;开发区招商,需要知道某条产业链的关键环节有哪些企业、分布在哪、哪些有外迁或扩产可能。两个场景的共同点是:需要的不是单家企业的深度信息,而是某一类企业的完整画像。

情景 A 下:这是情景 A 价值最大的场景。金融机构本来就是公共数据授权运营的第一批服务对象——2026 年各省试点的企业活性产品,主要用户就是本省银行的普惠信贷。情景 A 铺开之后,用电、社保、开票三个信号合起来的「经营活性指数」,会成为县域授信的标准输入。区域招商则受益于公共层的空间聚合能力——某个产业链环节在全国的产能分布,按用电量聚合比按企业数量聚合准确得多。

情景 B 下:运营底座提供的「经营活性旁证」——持续招聘、稳定社保、连续中标、正常交易——是公共层缺位时的替代方案。准确度不如公共层,但对识别壳企业和僵尸企业效果明显。招商场景下,底座的产业带数据和图谱能力直接可用。

情景 C 下:模型可以为一家具体企业实时生成一份「经营状况摘要」,但金融机构不会把它作为授信依据——没有审计记录、没有责任主体。招商场景下,模型可以快速生成一份产业链图谱的初稿,但精度不足以支撑决策。情景 C 在这个场景下的角色是「起草」,不是「决策依据」。

三个情景的共同趋势:这个场景最需要「可问责的数据」。 授信和招商都是要对结果负责的决策,决策依据必须能追溯到一个可以被问责的来源。这一点上,情景 A 的公共层和情景 B 的运营底座都能提供,情景 C 不能。

四十四、三种定价路径

三个情景对应三条完全不同的定价逻辑,而定价决定了「谁为加工买单」这个第一篇结尾留下的问题在五年后的答案。

情景 A:准许收益定价。 公共层按「经营成本加准许利润」核定上限收费标准,准许利润率为 10 年期国债平均收益率加不超过 6 个百分点,按调用量计价。这条路径的含义是:经营状态层的加工成本,由公共部门先行垫付,再通过受管制的调用费回收。 市场层(产业属性)仍按市场价。整体价格水平会明显低于今天,因为最基础的那一层变成了准公用事业。

情景 B:按次市场价。 运营底座按调用次数收费,单价由市场竞争决定,2026 年的量级在每次 0.1 元到 0.25 元。调用量随智能体普及上升,固定成本被摊薄,单价可能小幅下降,但集中度上升之后头部底座有定价权。这条路径的含义是:加工成本由所有调用者分摊,加工者需要垫付数年,回收周期取决于调用量拐点。 这正是第一篇第 34 章「路径一」的完整展开。

情景 C:免费内嵌。 模型厂商把企业信息检索做成内置能力,不单独收费,成本计入模型订阅或按 token 计费。这条路径的含义是:加工成本被隐藏进模型的使用成本里,用户感知为「免费」。 但它有一个隐含的问题:模型厂商没有动力做持续核验——核验不产生 token 消耗,也不产生订阅收入。免费内嵌的信息,质量会稳定在「实时抓取能达到的水平」,不会更高。

三条路径放在一起,可以看到一个规律:加工投入的可持续性,与加工者能否从加工中直接获得收入成正比。 情景 A 有准许收益,情景 B 有调用费,情景 C 没有——所以情景 C 的加工质量天花板最低。

这也回答了第一篇的那个问题。五年后「谁为加工买单」最可能的答案是分层的:经营状态层由公共部门垫付、调用者按准许收费回收;产业属性层由市场化底座垫付、调用者按市场价回收;浅层查询由模型厂商垫付、用户以订阅费间接支付。三层各有各的买单者,没有任何一层是无人买单的——这与 2026 年「通用产业数据加工落在四条买单路径的缝隙里」相比,是一个实质的改善。

前提是情景 A 和 B 都至少部分发生。如果只有情景 C 发生,加工投入会持续不足。

四十五、跨境:三个情景下的数据身份

第一篇和第二篇都讨论过「出海的数据身份」:中国的几百万家工厂需要一份能被境外买家读懂、核验、持续更新的画像;统一社会信用代码在国内权威但在境外可识别性有限;欧盟 CSDDD 的链式传导在提高境外买家的合规要求。

三个情景下,这件事的路径不同。

情景 A 下:公共层不出境,市场层做翻译。 税务、社保、用电数据聚合成的经营活性产品,即便脱敏,也很可能被认定为需要审慎处理的数据,不会直接向境外提供。跨境数据身份要由市场层构建——把公共层的经营状态结论(不是原始数据)与市场层的产能画像组合成一份面向境外的企业档案。这份档案的可信度背书来自公共层,但交付由市场层完成。

情景 B 下:运营底座直接提供跨境产品。 这是情景 B 先行信号里的 B6。运营底座的企业公开信息层不涉及个人信息与重要数据,出境合规负担轻;它可以直接向境外买家提供中文企业的英文画像,按调用收费。联系方式字段在跨境产品里只提供企业级,不提供个人级。

情景 C 下:境外买家直接用模型。 一个德国采购经理让模型「找几家中国的精密压铸厂」,模型实时抓取中文网页给出候选。语言障碍被模型消除了,但信息可靠性的问题原封不动——模型给出的候选没有核验、没有责任主体。境外买家在情景 C 下会遇到与国内买家相同的问题,而且因为无法实地核验,问题更严重。

三个情景的共同点:跨境数据身份是一个五年内确定会增长的需求,且它天然偏向有核验、有责任主体的供给方。 境外买家对「谁对这条信息负责」的要求,比国内买家更高——因为出了问题他们更难追索。这使得跨境场景在三个情景中都更有利于 A 和 B,不利于 C。

还有一个反向的观察:中国工厂的数据身份被境外核验,也意味着中国的口径会被境外参照。如果运营底座的口径文档被境外采购方采用为供应商核验的依据,那么变量五讨论的「事实标准」可能先在跨境场景里形成,再反过来影响国内。这是一条今天还看不清、但值得盯住的路径。

第六部 分叉点、观测清单与分层组合

三个情景不会同时以完整形态出现。本部标出三个时间上的分叉点,列出可供观测的信号清单,用第二篇的历史给三个情景各找一个先例,最后讨论最可能出现的分层组合。

四十六、分叉点一:2026 年底——行动计划收官

「数据要素×」三年行动计划(2024—2026 年)在 2026 年底收官。行动计划的目标是到 2026 年底打造 300 个以上示范性强、显示度高、带动性广的典型应用场景,培育一批优质数据商和第三方专业服务机构。

收官评估的内容,是第一个分叉点的观测对象。要看的不是 300 个场景有没有凑够,而是三件事:

其一,工业制造赛道的典型场景里,有多少个使用了多部门企业数据。 如果收官评估中出现「基于税务、社保、用电数据的企业活性画像」类场景并被作为典型推广,情景 A 的公共层有了第一个官方样本。如果工业制造场景全部是企业内部数据(设备、工艺、质量)的应用,情景 A 的分叉暂时没有打开。

其二,「优质数据商」的名单里有没有通用产业数据底座。 行动计划提出培育数据商,收官时会有某种形式的名单或案例。名单里如果出现以「全国工厂数据」为主营的机构,说明政策视野已经覆盖到通用底座,情景 B 的激励路径有了起点。

其三,下一阶段的行动计划怎么写加工环节。 三年行动计划收官后,「十五五」期间大概率会有后续文件。后续文件对「数据商培育」「数据加工」的表述是原则性的还是有具体措施,是变量四走向的直接指示。

2026 年底的这个分叉点,决定的是情景 A 与情景 B 之间的早期倾向,还不能决定最终结果。

四十七、分叉点二:2028 年——两个行动同时到期

2028 年是五年窗口里最关键的一年。两个既定目标同时到期:《可信数据空间发展行动计划(2024—2028 年)》的「建成 100 个以上可信数据空间」,以及《关于推进行业高质量数据集建设行动的实施方案》的「到 2028 年底建成一批覆盖重点领域、经过应用验证的行业高质量数据集」。

这两个目标的落地形态,是第二个分叉点的观测对象。

可信数据空间里有没有「企业数据空间」。 行动计划分类推进企业、行业、城市、个人、跨境五类空间。如果到 2028 年建成的 100 个空间里,出现了以「企业经营数据共享」为主题、参与方包括政府部门与市场机构的空间,那么公共层向市场开放的通道就打通了——情景 A 的必要条件成立。如果 100 个空间主要是行业内部(如汽车产业链上下游)或城市治理类的,公共层的企业数据仍然留在政务内部,情景 A 的窗口在 2028 年之后会明显收窄。

行业高质量数据集的建设经验有没有外溢到企业数据。 高质量数据集建设行动已经形成了标准、质检、基准验证的一整套方法。如果这套方法在 2028 年被用于企业经营数据产品的质量管理——比如授权运营机构按高质量数据集的标准给企业活性产品做质检——那么公共层产品的可信度就有了制度保障。

变量一在 2028 年的读数。 这一年也是判断情景 C 的关键年:主流模型在「找一批」类全量筛选任务上的表现,是否达到商业底座的初筛水平。第三部给情景 C 的时间线把 2028 年定为「中等任务替代」的年份,这一年的模型能力读数直接决定情景 C 的份额。

2028 年之后,三个情景的相对份额基本确定,2029 到 2031 年是既定路径的展开。

四十八、分叉点三:模型能力的阈值——不是一个日期

第三个分叉点不是一个时间点,而是一个能力阈值:主流模型单次任务可稳定读取并交叉验证的网页数量,跨过「数百」这个量级。

这个阈值之所以关键,是因为它决定了情景 C 能吃掉多深。在「数十」量级,模型只能做单点查询(查一家),情景 C 只影响浅层产品;在「数百」量级,模型可以做中等规模的筛选(找几十家),情景 C 开始侵入情景 B 的初筛层;在「数千」量级,模型可以做全量筛选(找全部),情景 C 的主体部分成立。

这个阈值可能在 2027 年跨过,也可能到 2031 年还没跨过。它取决于上下文长度、工具并行度、推理成本三条曲线的合力,而这三条曲线的斜率都有相当的不确定性。

本文不预测它何时跨过。本文给出的是:跨过之前,情景 B 是主导路径;跨过之后,情景 C 的份额显著上升,但受第三部五条理由的限制,不会完整替代。

对从业者而言,这个分叉点的实用含义是:不要押注它「不会跨过」,也不要押注它「一定跨过」;应当把自己的价值放在阈值两侧都成立的位置上——持续核验、时序积累、审计责任。这三件事在阈值两侧都不会被模型替代。

四十九、二十个先行信号

把第二部七个变量的可观测指标和第三部三个情景的先行信号合并去重,得到下面这份清单。每个信号标注它指向哪个情景、属于必要信号还是加速信号。

编号 信号 指向 性质
1 省级授权运营目录出现基于两个以上部门数据的企业活性产品 A 必要
2 企业类公共数据产品公布按调用量计价的上限收费标准 A 加速
3 「一本账」实施方案明确纳入税务、社保、电力数据 A 加速
4 公共数据产品提供 MCP 或等价的机器可调用接口 A 必要
5 主要商业数据机构宣布接入公共层企业活性产品 A 加速
6 可信数据空间中出现政企共同参与的企业经营数据空间 A 必要(2028)
7 主流模型客户端内置商业产业数据源 B 必要
8 商业底座按次价格两年内稳定或上涨 B 必要
9 至少一家商业底座公开完整口径文档并被第三方引用 B 加速
10 数据商培育办法落地且含通用底座支持条款 B 加速
11 商业底座披露接口调用量且年增速在一个数量级以上 B 必要
12 面向境外买家的中国工厂画像产品上线并被采用 B 加速
13 主流模型单次任务可读网页量从数十跃升到数百以上 C 必要
14 模型客户端中企业类问题的实时检索使用占比与满意度上升 C 加速
15 主要模型厂商推出企业检索与判定的内置工具 C 加速
16 商业平台「单家查询」类调用量下降而「全量筛选」类持平或上升 C 确认
17 司法或监管对模型实时大规模抓取企业信息的明确态度 C 边界
18 国家或行业标准立项「企业生产活动判定」类标准 横切(口径) —
19 国内出台企业联系人信息商业化处理的专项规则或执法案例 横切(合规) —
20 数据资产入表出现针对持续核验投入的资本化路径 横切(激励) —

这份清单的用法是:每半年过一遍,标出哪些已经出现、哪些出现了相反的迹象。三年之后,清单上打钩的分布,就是三个情景的实际份额。

本文在 2026 年 9 月的读数是:二十个信号中,第 7、9、12 三个已有初步迹象(商业底座已提供 MCP 接口、已有机构公开判定规则、跨境产品已在讨论中),其余十七个尚未出现。也就是说,2026 年 9 月的读数偏向情景 B 的早期,但远未到可以下结论的程度。

五十、历史先例:三个情景在第二篇里的影子

第二篇回顾了一百二十年,三个情景在那段历史里各有一个先例。先例不能预言结果,但能提示每条路径的固有性质。

情景 A 的先例是 2014 年的「全国一张网」。 国家把企业基础登记信息做成免费公共品,商业机构被推到加工层。它证明了公共部门可以用极高的效率解决基础层,也证明了公共层一旦建成,商业机构在那一层的价值会被彻底压缩——2014 年之后没有任何一家商业机构靠「汇聚工商信息」本身赚到钱。情景 A 的公共层如果建成,对「经营状态推断」这一层的商业价值,会是同样的效果。

先例也提示了情景 A 的固有性质:公共层解决的是它被设计来解决的问题,不会主动延伸。 「全国一张网」服务于信用监管,十二年来没有向产业属性延伸一步;情景 A 的公共层服务于金融风控与产业管理,同样不会延伸到「在造什么」。市场层的空间是稳定的。

情景 B 的先例是邓白氏,以及 2014 年之后的中国企业信息查询工具。 前者用一百八十年证明了运营积累可以形成不可替代性;后者用十年证明了公示数据之上的加工空间是真实的、有人付费的、规模以十亿元计的。情景 B 的运营底座,是这两条先例在产业属性层的延伸。

先例也提示了情景 B 的固有性质:行业的自然形态是长周期、低增速、高壁垒。 邓白氏一百八十四年营收 23.8 亿美元;查询工具十年做到营收以亿元计。情景 B 下的运营底座不会是一门爆发式增长的生意,它的价值来自不可替代性,而不可替代性来自时间。用互联网的增长曲线去要求它,会导致战略变形。

情景 C 的先例是 2000 年代的搜索引擎竞价排名。 搜索引擎绕开了 B2B 平台的围墙——企业只要有官网就能被找到,不必进入任何平台的会员体系。它证明了一个通用的检索能力可以绕过专门的信息中介。情景 C 的模型直采,是同一逻辑在更高能力层级上的重演。

先例也提示了情景 C 的固有性质:通用检索绕过了中介,但没有解决中介本来要解决的信任问题。 竞价排名把「被找到的顺序」标价出售,检索结果反映出价而不是匹配度,信息质量问题以另一种形式加剧。模型直采绕过了预加工底座,但没有解决核验、一致性、责任的问题——它们会以「流畅但不可靠的答案」的形式重新出现。

三个先例合起来,指向一个跨越情景的判断:每一条路径都会解决它擅长的那部分,把它不擅长的那部分留给别人。 没有任何一条路径能独占全部。

五十一、分层组合:最可能的形态

三个情景各推到了尽头,现在回到最可能的现实:它们会以分层组合的形式同时存在。

本文对 2031 年的推演形态如下:

底层:公共层给经营状态。 如果情景 A 的必要信号(1、4、6)在 2028 年前出现,主要省份的授权运营产品会提供「是否在经营、规模多大、是否正常」的判断,按准许收费、按调用量、通过标准接口。这一层的覆盖可能不均匀——数据基础好的省份先行——但方向会确立。如果必要信号没有出现,这一层由情景 B 的运营底座用公开信号逼近,准确度低一档。

中层:商业底座给产业属性。 无论情景 A 是否发生,「在造什么、工艺如何、产业带归属、谁能拍板、历史怎么变」这些字段都留在市场层。两到三家通用运营底座加若干垂直加工者,按次调用,口径披露成为规范,时序积累成为壁垒。这一层是情景 B 的核心,也是三个情景里最确定会存在的一层。

表层:模型做理解与浅层查询。 情景 C 吃掉浅层——「查一家企业的基本情况」这类需求由模型实时完成,用户不再为此付费。模型同时承担前端的需求理解(把「找华东做医疗级注塑的厂」翻译成对底层和中层的调用)和后端的结果组织(把调用结果组织成用户能用的答案)。模型不做持续核验,不做时序积累,不承担责任。

三层之间的分工由一条边界划定:这个信息能不能靠实时抓取可靠地得到。 能的归模型,不能的归底座;底座里由公共数据决定的归公共层,由产业属性决定的归市场层。

这个分层组合与 2026 年的现状相比,有三个实质变化:

  • 经营状态的判断准确度会有一次跃升(如果公共层开放);
  • 浅层查询会免费化(模型替代);
  • 产业属性层的竞争会集中到时序、口径、核验三件事上。

而它与 2026 年的现状相比,有一件事没有变:第一公里仍然需要有人走。 公共层需要授权运营机构持续加工多部门数据,市场层需要运营底座持续核验存量,模型层需要模型厂商持续维护抓取能力。三层各有各的加工者,加工这件事本身没有消失,只是分成了三份。

这就是本文对「五年后」的核心判断:加工不会被取消,会被分层。 分层之后,每一层的加工者都比今天更清楚自己该做什么、能收什么钱、对什么负责。这是一个比 2026 年更好的形态——如果它能发生的话。

五十二、政策目标与情景的对照

五年窗口内已经写进文件的政策目标,各自会向哪个情景输送动力?下面把它们逐一对照。这张表的用处是:当某个目标如期或超前完成时,读者可以直接判断它推动了哪条路径。

目标 出处 到期 主要推动的情景 推动方式
300 个以上数据要素典型应用场景 「数据要素×」三年行动计划 2026 年底 A 或 B 取决于工业制造场景里用的是多部门企业数据(A)还是商业底座(B)
培育一批优质数据商 同上 2026 年底 B 若名单含通用产业数据底座,B 的制度身份确立
建成 100 个以上可信数据空间 可信数据空间发展行动计划 2028 年 A 若出现政企共建的企业数据空间,公共层通道打通
建成一批行业高质量数据集 行业高质量数据集建设行动实施方案 2028 年底 A 与 B 间接 质检、基准验证的方法可外溢到企业数据产品
1000 个高水平工业智能体 「人工智能+制造」专项行动实施意见 2027 年 B 与 C 制造对外部数据源的调用需求(B);同时推动模型内置能力(C)
100 个工业领域高质量数据集 同上 2027 年 B 间接 行业知识沉淀,与底座的产能字段加工互补
智能体应用普及率超过 70% / 90% 「人工智能+」行动意见 2027 / 2030 年 B 与 C 调用量的总盘子;模型能力的总投入
建立全国数据资源「一本账」 「十五五」规划纲要 2030 年 A 多部门数据汇聚是公共层的前提
构建全国统一的数据产权登记体系 同上 2030 年 A 与 B 登记体系让公共层产品与商业底座的权属都可确认
建设开放共享安全的全国一体化数据市场 同上 2030 年 A 与 B 跨省互认(A)、全国流通(B)的制度基础
数据资源以成本计量入表 财政部等四部门通知 持续 约束 B 限制底座的资产化路径,延长垫付期
严控数据交易所数量 四部门培育数据流通服务机构意见 持续 与情景无关 场内不是工厂数据的主渠道

从这张表可以读出三件事。

第一,没有任何一个政策目标单独指向情景 C。 情景 C 的动力来自技术曲线和模型厂商的商业选择,不来自政策。这意味着情景 C 的先行信号要到技术与市场里去找,政策文件里找不到。

第二,情景 A 的政策动力最集中,但落地最依赖执行。 「一本账」、可信数据空间、一体化市场三个目标都指向公共层,但它们的成果形态有极大的自由度——「一本账」可以停在政务内部,可信数据空间可以全是行业内部空间,一体化市场可以只覆盖合规信息。政策目标完成,不等于情景 A 发生。

第三,情景 B 的政策动力是间接的。 除了「培育数据商」,没有任何目标直接指向商业底座。情景 B 的动力主要来自需求侧(智能体目标)而不是供给侧。这与本文第六部的观测读数一致:2026 年 9 月偏向情景 B 早期,靠的是市场机构自己做的事,不是政策。

这张表还提示了一个观测方法:每年年底,把当年到期的目标逐一核对,不看「完成没完成」,看「完成的形态是哪一种」。形态决定它推动了哪个情景。

五十三、情景之间的转换

三个情景加一个停滞情景,不是四个静止的终点,而是四种可以互相转换的状态。五年里,路径可能从一个情景滑向另一个。理解转换的机制,比判断「哪个情景会赢」更有用——因为转换往往在信号出现之前就有了条件。

从 B 到 A:商业底座成熟之后被公共层接管经营状态层。 这是最可能的一种转换。商业底座先用公开信号把经营状态判断做到可用,市场接受了「按调用付费买经营状态」这件事;然后公共层带着更硬的数据(用电、社保、开票)进场,以更高的准确度和受管制的价格提供同一层判断。商业底座被迫把资源集中到产业属性层。转换的条件是:公共层开放的时间晚于商业底座证明市场存在的时间。如果公共层先开放,就直接是情景 A,没有转换;如果商业底座先做起来,公共层跟进,就是 B 到 A。第六部「分层组合」描述的形态,本质上就是这个转换完成之后的状态。

从 C 到 B:模型厂商建立核验体系后变成运营底座。 第三部情景 C 的证伪条件里写过这一条:如果模型厂商发现实时抓取的结果不可靠,转而建立自己的持续核验体系——保存快照、维护口径、提供审计——那它就变成了一个运营底座,只是这个底座的所有者是模型厂商而不是独立的数据机构。转换的条件是:模型厂商愿意承担核验的固定成本。这与它们的商业模式有冲突——核验不产生 token 消耗——但如果企业信息成为模型的关键竞争力,它们可能会做。这个转换会让情景 B 的赢家换人,但情景 B 的结构不变。

从 A 到停滞:公共层建成但迟钝,市场层失去动力。 情景 A 的四个风险里,「运营机构的动力」那一条如果成真,会导致这种转换。公共层建成了,但更新慢、接口差、口径不一,市场层的加工者发现接入公共层不如自己做,但自己做又被公共层的存在压低了收费空间——两头都不成立,投入萎缩,退回停滞。转换的条件是:公共层「建成」的标准只看有没有,不看好不好用。

从停滞到 B:跨境需求倒逼。 停滞情景的三个「不太可能」的理由里,跨境需求是最硬的一条。如果国内市场停滞,但境外买家的合规要求持续上升,「出海的数据身份」会成为第一个真正有付费意愿的场景,商业底座可能从跨境产品起步,反过来带动国内的调用量。转换的条件是:境外需求的支付意愿高于国内,且不受国内停滞影响。

从 B 到 C:底座自己放弃核验。 这是一种自毁式转换。运营底座在调用量拐点迟迟不来的压力下,为了压缩成本降低核验频率,数据质量下滑到与模型实时抓取相当的水平——那时用户就没有理由为底座付费了,情景 B 退化为情景 C,只是没有模型厂商得到好处。转换的条件是:底座把「覆盖」当作壁垒而不是「核验」,在压力下先砍核验。第八部给数据加工者的第一条「应当避免的错误」,就是防止这个转换。

五种转换合起来,可以画出一张状态图:B 是枢纽——它可以转向 A(被公共层接管)、转向 C(自己放弃核验或被模型厂商内化)、从停滞转来(跨境倒逼);A 可以退回停滞;C 可以转回 B。四个状态中,只有 B 与其他三个都相连。 这不是本文偏向情景 B 的另一种表述,而是结构使然:运营底座是唯一一个「有人在持续做核验」的状态,其他三个状态要么核验由公共部门做(A),要么没人做(C 与停滞)。核验在哪里,转换的枢纽就在哪里。

对观测清单的补充:五种转换各有一个先行信号——B 到 A 看公共层开放的时间与商业底座证明市场的时间谁先谁后;C 到 B 看模型厂商是否开始保存企业信息的历史快照;A 到停滞看公共层产品的更新频率与接口质量;停滞到 B 看跨境产品的付费用户数;B 到 C 看头部底座的核验频率是否下降。这五条可以并入第六部的二十个信号之后,作为第二十一到二十五号观测项。

第七部 五个行业、三个数字、一笔账、一条时间轴

前面的推演都在「制造业」这个层面上进行。但制造业内部的差异极大——一家汽车零部件厂与一家袜厂的数据需求、数据形态、被数据化的难度完全不同。本部先把三个情景放进五个具体行业里看,然后做三个数字的外推,算一笔加工成本的账,最后把全文的时间线合成一张表。

五十四、汽车零部件:供应链穿透的样板行业

汽车零部件是产业主体数据需求最刚性的行业之一。原因有三:主机厂的供应商体系有明确的层级(一级、二级、三级),断供的代价极高(产线停摆),且行业有统一的质量体系认证(IATF 16949)作为硬信号。

情景 A 下:公共层的用电与社保数据对这个行业特别有用——零部件厂的用电曲线与主机厂的排产高度相关,用电量下降是断供风险最早的信号之一。二级、三级供应商的经营状态由公共层给出,主机厂的供应链风险管理第一次有了不依赖供应商自报的数据基础。

情景 B 下:运营底座的时序数据与关系图谱是这个行业的核心工具。「我的二级供应商集中在哪几个产业带、有没有单点依赖」这个问题,需要底座的产业带数据;「哪家供应商的招聘在减少、中标在减少」这个问题,需要底座的时序。这个行业会是运营底座最早的深度用户之一。

情景 C 下:模型可以快速找出「全国能做某种铝合金压铸件的厂」,但无法回答「哪家的风险在上升」。这个行业对变化检测的需求太强,情景 C 只能覆盖它的候选环节。

这个行业的推演结论:它是三个情景中情景 A 和 B 价值最高的行业,也是情景 C 最不适用的行业。 如果情景 A 要找一个先行示范的行业,汽车零部件是最合理的选择——需求方集中(主机厂数量有限)、信号明确(认证、用电、社保)、决策后果重(愿意付费)。

五十五、电子制造:主体与工厂分离最严重的行业

电子制造有一个特殊的结构:品牌商、方案商、代工厂、贸易商之间的分工极细,同一个产品可能经过四五个主体才到终端。「这家企业是不是工厂」这个问题在电子行业最难回答——一家有几百人的公司可能只做方案与销售,生产全部外包给代工厂;一家名字里带「电子」的公司可能是纯贸易商。

第一篇讨论 B2B 平台数据的系统性偏差时说,「店铺主体与生产主体不一致的比例很高」——电子行业是这个偏差最严重的行业。

情景 A 下:公共层的用电数据是区分「有产线」与「无产线」的最硬信号——方案公司的用电量与代工厂的用电量差着数量级。这个行业从公共层获得的价值,主要是把生产主体从贸易与方案主体里分离出来。

情景 B 下:运营底座用招聘信号做同样的事:招 SMT 操作工、贴片工程师、测试员的是工厂,招销售、采购、FAE 的是方案商或贸易商。准确度不如用电,但可用。底座在这个行业的差异化在于产能字段——SMT 线体数量、贴装能力、认证(如车规、医疗)。

情景 C 下:模型读招聘信息与官网,能做初步的主体类型判断,且电子行业的企业普遍有官网、有平台店铺,模型的原料相对充足。情景 C 在这个行业的表现会好于平均——但仍然无法核验。

这个行业的推演结论:它是「身份」这一格最考验数据源的行业。 三个情景在这里的差距最直接地体现在「能不能分清工厂与非工厂」上。

五十六、化工:贸易层级多、资质是硬信号

第二篇讲 1997 年中国化工网时说,化工品的贸易层级极多,一个懂行的编辑才分得清生产商与贸易商。这个特点在五年内不会变。同时化工行业有一类特别硬的信号:与危险化学品、安全生产、环保相关的行政许可。这些许可需要现场核查、定期复审,造假成本极高。

情景 A 下:公共层在这个行业的价值最高——安全生产、环保部门的许可与检查记录本来就是公共数据,加上用电、社保,化工企业的经营状态可以被相当准确地判断。而且化工行业的公共数据有一个特点:监管本身要求它公开(许可公示、处罚公示),合规障碍比其他行业小。

情景 B 下:运营底座在这个行业需要更深的行业知识——产品词的归一(同一种化学品有商品名、学名、俗名、CAS 号)、贸易商与生产商的区分、许可的有效性核验。这正是第二篇说的「产业信息的可信度与加工者对行业的理解深度正相关」。垂直加工者在这个行业比通用底座有优势。

情景 C 下:模型对化学品名称的归一能力很强(它能识别 CAS 号与各种名称的对应),但对「这家企业是生产商还是贸易商」的判断,需要读许可信息,而许可信息在公示系统里,模型实时抓取的可靠性一般。

这个行业的推演结论:它是公共数据价值最高、垂直加工者最有空间的行业。 通用底座在这里的相对优势最小。

五十七、纺织服装:产业带与个体户的行业

诸暨的袜业、柯桥的纺织、晋江的鞋服、虎门的服装——第二篇讲产业带时列举的例子,一半在纺织服装。这个行业有两个数据特征:产业带集聚度极高,个体工商户形态的生产主体占比极高。第一篇讨论 404.9 万法人单位与 480 万工厂档案的差异时说,差异主要来自个体工商户形态的加工主体——这个差异在纺织服装行业最集中。

情景 A 下:公共层在这个行业的覆盖会明显偏弱。个体工商户的社保数据缺失严重(大量不缴或按最低标准缴),用电数据可能挂在厂房出租方名下而不是实际生产者名下,税务数据在小规模纳税人层面粒度粗。公共层能覆盖法人形态的工厂,覆盖不了产业带里那一大片作坊。

情景 B 下:运营底座的产业带数据是这个行业的关键工具。「诸暨大唐做袜子的厂有多少家、哪些做外贸、哪些有自己的品牌」这类问题,需要的是坐标与品类的联合聚类,加上对产业带内部配套关系的理解。底座在这个行业的覆盖成本最高(主体分散、信息少、变化快),但一旦覆盖,壁垒也最高——因为别人也覆盖不了。

情景 C 下:模型在这个行业的表现最弱。产业带里的小厂普遍没有官网、不在平台上、招聘靠熟人,模型实时抓取几乎没有原料。情景 C 在这个行业基本不成立。

这个行业的推演结论:它是三个情景中覆盖最难、数据最稀疏、但一旦覆盖壁垒最高的行业。 情景 B 的运营底座在这里的相对优势最大。

五十八、机械装备:长尾品类与语义抽取

机械装备的品类长尾极长——第一篇讨论分类时用的例子(C3351 切削工具制造下面的几十种刀具)就来自这个行业。国民经济行业分类的 1382 个小类装不下它的产品,经营范围更是几乎无用。这个行业的产能信息几乎全部在非结构化文本里:官网的产品页、招聘的设备要求、专利的技术领域、中标的标的物描述。

情景 A 下:公共层对这个行业的产能几乎没有帮助——政府部门不采集产品与工艺信息。公共层能给出经营状态,给不出「这家厂能做什么」。这个行业的核心问题全部留在市场层。

情景 B 下:运营底座在这个行业的价值集中在产能字段:产品词库、同义归一、能力标签(「五轴加工」「大型铸件」「精密磨削」)。这是第一篇说的「语义墙被凿开」之后收益最大的行业——大模型抽取非结构化文本里的产能信息,在机械装备行业的召回提升最显著。

情景 C 下:这是情景 C 表现最好的行业。机械装备企业普遍有官网、产品页详细、招聘信息里设备类型明确,模型读这些文本判断「这家厂能做什么」,准确度可以相当高。但情景 C 的老问题依然存在——它读到的是企业自己说的,核验不了;而机械装备恰恰是「说能做」与「真能做」差距最大的行业之一。

这个行业的推演结论:它是「产能」这一格最重要的行业,也是情景 C 侵入最深、但核验需求最强的行业。 五年后,机械装备行业的产业数据会呈现「模型给候选、底座给核验」的典型分工。

五十九、三个数字的外推

情景分析通常不做数字外推,因为外推容易变成伪精度。本文做三个,但每一个都只给区间、只给假设、只给量级,不给点值。

数字一:数据生产总量。 基线是 2025 年 52.26 ZB,2024 年 41.06 ZB,年增 27.28%。假设五年内年增速在 15% 到 27% 之间(下限对应增速回落至 2020 年代初的水平,上限对应维持当前增速),到 2030 年的生产总量在 105 ZB 到 174 ZB 之间。结论只有一个:翻一倍到三倍。 具体是哪个数字不重要,重要的是数据不会短缺。

结构化率的外推更粗糙:2025 年结构化存储增速 43.59%,生产总量增速 27.28%,若两者的差保持不变,结构化数据占生产总量的比例每年提升约 13%,五年后从约 1% 升到约 2%。结论:到 2030 年,仍有九成八以上的数据是非结构化的。 加工的杠杆不会变小。

数字二:制造业法人单位。 基线是 2018 年末 327.0 万、2023 年末 404.9 万,五年增长 23.8%。下一次经济普查以 2028 年末为标准时点。假设五年增速在 10% 到 24% 之间(下限对应主体增长放缓,上限对应延续上一个五年),2028 年末制造业法人单位在 445 万到 502 万之间。结论:数百万量级不变,且大概率继续增长。 这个外推的口径是法人单位,与工厂档案口径不可比——本文列出它,只是为了说明核验工作量的下限不会缩小。

数字三:接口调用量。 这个数字没有公开基线,本文不做点值外推,只给量级逻辑:2027 年 1000 个高水平工业智能体的目标,加上智能体普及率超过 70% 的目标,意味着面向制造业的智能体数量在千个量级。假设其中一部分需要外部产业主体数据源,每个智能体日均调用几十到几千次不等,总调用量在日均十万到千万次的区间——跨了两个数量级。结论:调用量的区间太宽,不足以支撑任何具体判断,但它的下限已经足以让按次分摊模式有讨论的意义。 下一章算这笔账。

三个外推的共同点是它们都只给出了「量级不变」或「翻几倍」这类粗结论。这不是本文能力不足,而是本文的规则三——不给伪精度——在数字上的执行。

六十、第一公里的成本:一笔示意的账

第一篇第 34 章把加工的经济特征描述为前置、重资产、回收周期长、正外部性强,但没有算账。本章算一笔——全部输入都是假设,结论只看量级。

成本侧:

存量规模按 480 万家工厂档案计(这是基线)。假设每年需要核验更新的记录比例为三分之一(第一篇对字段半衰期的分析给出的下限),即每年约 160 万条。假设单条记录的综合核验成本——含算力、人工抽查、数据获取的分摊——在 5 元到 30 元之间(下限对应高度自动化、上限对应较多人工介入),则年核验成本在 800 万元到 4800 万元之间。再加上采集体系、平台运维、词典与分类维护、合规体系的固定投入,一个通用底座的年投入量级在数千万元到亿元。

这个量级的含义是:它远超一家小机构能承担的水平,但远低于一项国家级基础设施的水平。 它恰好落在「市场化机构可以做、但需要相当规模的调用量才能回本」的区间里——这正是第一篇说的「缝隙」在数字上的样子。

收入侧:

按次调用价格按 2026 年的公开量级计,每次 0.1 元到 0.25 元。要覆盖 5000 万元的年成本,需要 2 亿到 5 亿次年调用,即日均 55 万到 137 万次。

把这个数字与上一章「数字三」的区间对照:日均十万到千万次。收入侧需要的调用量,落在需求侧可能区间的中段。 也就是说,按次分摊模式在五年内跑通是可能的,但不是必然的——它取决于智能体的普及速度和其中接入外部数据源的比例,这两个都是变量七里的不确定项。

账的含义:

这笔示意的账说明了三件事:

其一,情景 B 的拐点不是幻想,它有一个可以估算的调用量门槛,而这个门槛在需求侧的可能区间之内。

其二,拐点之前的垫付期是真实的——按上述假设,一个底座在调用量达到日均几十万次之前,每年要承担数千万元的净投入。能承担几年,决定了它能否等到拐点。

其三,公共层如果出现(情景 A),会改变这笔账的结构——经营状态层的核验成本由公共部门承担,商业底座的核验范围缩小到产业属性层,年成本可能减半,拐点门槛随之下降。这是情景 A 与情景 B 的分层组合在经济上比单一情景更稳的原因。

再强调一遍:这笔账的每一个输入都是假设,读者可以替换任何一个数字重算。本文提供的是算法,不是答案。

六十一、一条时间轴

把全文涉及的确定事件与推演事件合成一张表。「确定」一列是已经写进文件的目标或已经发生的事实;「推演」一列是本文在各情景下的判断,读者应当按第六部的观测清单逐年核对。

年份 确定(已发生或已写进文件) 推演(本文判断)
2026 「数据要素×」三年行动计划收官;「十五五」纲要提出全国一体化数据市场;DROP 平台 8 月起强制合规;生成式 AI 备案累计近千款 商业底座接口化,智能体开始接入;分叉点一:收官评估中是否出现多部门企业数据场景与通用底座数据商
2027 八部门目标:1000 个工业智能体、100 个工业高质量数据集;国务院目标:智能体普及率超过 70% 浅层查询开始被模型替代;省级企业活性产品试点(若情景 A);数据商培育办法(若变量四落地)
2028 可信数据空间 100 个以上到期;行业高质量数据集建设行动到期;第六次全国经济普查标准时点 分叉点二:企业数据空间是否出现;商业底座调用量拐点(若情景 B);模型「找一批」能力读数(情景 C 关键年)
2029 六经普数据陆续发布(制造业法人单位新读数) 集中期:两到三家通用底座 + 垂直加工者;跨省公共层互认(若情景 A);证伪条件的主要检验年
2030 「十五五」收官;国务院目标:智能体普及率超过 90% 分层组合定型;三条定价路径并存;口径披露成为规范
2031 — 本文推演的终点:加工被分层而非取消;事实标准部分形成;可信度成为唯一边界

这张表的用法与第六部的观测清单相同:每年对一次,看「确定」一列是否如期发生,看「推演」一列有多少被证实、多少被证伪。

第八部 稳健策略:五类主体各自该做什么

情景分析的最终用途不是猜哪个情景会赢,而是找出在所有情景下都不会后悔的动作——规划学里叫「无悔之举」——以及只在特定情景下才值得做的押注。本部对五类主体分别列出:无悔之举、情景押注、应当避免的错误。

六十二、数据加工者

这一类包括通用底座、垂直加工者、以及任何以「把公开信息加工成产业数据」为主业的机构。它们是三个情景的直接当事方。

无悔之举:

从今天起保存每一次采集的完整快照。 这是第一篇、第二篇、本文第四部反复强调的那一条。它在三个情景下都是唯一无法被追补的资产:情景 A 下公共层未必开放时序,情景 B 下时序是最深的壁垒,情景 C 下模型没有时序。成本在今天极低,价值在五年后无法用钱买到。

公开口径文档。 把「什么算工厂、判定依据是哪些信号、置信度怎么分级、每个字段的核验方法与最后核验时间」写成文档并公开。情景 B 下它是事实标准的起点;情景 A 下它是与公共层对接的前提(公共层有口径,市场层必须能说清自己与它的差异);情景 C 下它是与模型实时结果区分的标志——模型给不出口径文档。

把合规做成产品配置而不是事后补丁。 脱敏存储、按权限解锁、逐笔审计、异议可删——尤其是「人」这一格。三个情景下合规都在收紧,做在前面的成本远低于事故之后的成本。

接口优先于界面。 五年内主要调用方是机器。把能力拆成原子操作、定义清楚每个字段的语义、给每种失败一个错误码、让每次调用可计量。人机界面可以保留,但不应再是产品的重心。

情景押注:

押情景 B:加大存量覆盖与核验频率的投入,争取在调用量拐点到来时已经是默认数据源。风险是拐点晚到,垫付期拉长。

押情景 A:提前把「经营状态推断」这部分能力设计成可替换模块,一旦公共层开放就切换过去,把资源集中到产业属性层。风险是公共层不开放,模块化投入浪费。

押情景 C:把自身定位从「数据提供方」转为「核验服务方」——不再卖数据,卖「模型给出的候选,我来核」。风险是这个市场比数据市场小得多。

应当避免的错误:

避免把「覆盖」当作壁垒。三个情景下覆盖都会被别人复制——公共层、其他底座、模型。壁垒只在覆盖之上的核验、时序、口径里。

避免以价格战争夺浅层市场。浅层查询会被模型免费化,为它降价是在补贴一个必然消失的市场。

避免用没有依据的准确率数字宣传。「准确率 98%」在口径披露成为规范之后会变成负资产。

六十三、买方:销售、采购与金融机构

这一类是第一篇说的三类需求方——向工厂销售的、寻找工厂的、接入数据的——中的前两类,加上产业金融与招商机构。

无悔之举:

要求数据源披露口径与核验时间。 无论从公共层、商业底座还是模型获取数据,都要求它说明「这条信息是怎么来的、什么时候核验的、置信度多高」。给不出的,按不可靠对待。这在三个情景下都是自我保护的最低要求——尤其在情景 C 下,模型输出的流畅答案最容易让人忘了问依据。

把「变化」纳入需求。 采购和金融的核心风险是「原来好的变坏了」,销售的核心机会是「原来不需要的开始需要了」。两者都是变化检测,都需要数据源有时序。选择数据源时,把「能不能告诉我什么时候变的」作为硬指标。

区分「候选」与「确认」两个环节的数据需求。 候选环节可以用便宜的、覆盖广的、精度中等的数据(模型实时结果也可以);确认环节必须用有核验、有责任主体的数据。不要用候选级的数据做确认级的决策。

情景押注:

押情景 A:与本省授权运营机构建立早期合作,成为企业活性产品的首批用户,在产品定型期影响它的字段与接口设计。金融机构在这一点上有天然优势。

押情景 B:与一到两家商业底座深度集成,把它嵌入自己的 CRM、SRM 或授信系统,换取更好的价格与定制能力。

押情景 C:在内部建立「模型初筛加人工核验」的流程,用模型降低初筛成本,用自建的核验团队保证决策质量。

应当避免的错误:

避免把模型的实时答案直接用于需要问责的决策。授信、大额采购、供应商准入,需要可追溯的依据。

避免只买「名单」不买「更新」。一次性名单的有效率按月衰减,五年后这种购买方式会显得非常落后。

六十四、政策制定者

这一类包括国家与地方的数据管理部门、工业主管部门、统计部门,以及公共数据授权运营机构。

无悔之举:

明确「加工」在数据商培育政策中的位置。 2026 年 2 月的四部门意见把数据商纳入了分类,下一步是培育办法。无论走向情景 A 还是 B,培育办法都应当对「通用产业数据底座」这类高固定成本、强正外部性、长回收期的加工活动有专门的表述——补贴、采购、资质、税收任选其一,但要有。没有的话,第一篇第 34 章描述的「缝隙」会持续存在。

推动口径披露的规范化。 不必急于制定统一的「什么算工厂」标准——那件事很难,而且用途不同标准不同。但可以要求:凡是面向市场提供企业类数据产品的机构(公共的或商业的),必须公开口径文档。这一条在三个情景下都能提升市场的可比性,且成本极低。

给公共数据产品配标准接口。 授权运营的企业类产品,从设计之初就提供机器可调用的接口,而不只是人机界面或批量交付。否则情景 A 的公共层即便建成,也无法被模型与应用消费,价值会打折。

把普查公报作为市场数据的校准基准公开得更细。 第二篇讨论过普查是「全量人工核验」的极致形态,其分行业、分地区的法人单位数是检验商业数据覆盖率的最好参照。公报的颗粒度越细(到县、到行业中类),市场数据的自我校准就越容易。

情景押注:

押情景 A:加快「一本账」中税务、社保、电力数据的汇聚,在两三个数据基础好的省份先做企业活性产品试点,2028 年前形成可复制的模式。

押情景 B:把商业底座纳入数据要素×典型场景,通过政府采购成为它们的早期客户,用采购而不是补贴支持通用底座。

应当避免的错误:

避免让公共层延伸到产业属性。政府部门不采集产品与工艺信息,公共层在这一层没有数据基础,强行做会得到低质量的产品,同时挤压市场层。

避免用交易所场内交易额衡量数据要素市场的进展。第一篇的判断在五年内不会变:场内不会成为主流,衡量指标应当转向调用量、数据商数量、加工投入。

六十五、模型与应用开发者

这一类包括模型厂商、智能体开发框架的提供方、以及在模型之上做行业应用的开发者。

无悔之举:

接入数据源时要求口径与审计。 把「数据源必须提供口径文档、最后核验时间、调用审计」作为选型标准。这既是应用质量的保障,也是应用自身在出问题时的免责依据。

在输出中标注信息来源与置信度。 模型把数据源的结果组织成答案时,保留「这条信息来自哪个源、核验时间是什么、置信度多高」的标注。第一篇第 24 章的判断——错误数据经过模型会被放大——在应用层的解法就是不让来源在组织过程中丢失。

区分「实时抓取」与「调用底座」两种模式,并让用户知道用的是哪种。 两种模式的可靠性不同,用户有权知道自己拿到的是哪一种。

情景押注:

押情景 C:模型厂商可以投入建设自己的企业信息内置工具,但要认识到第三部说的那件事——如果要做到可靠,模型厂商最终要建立自己的持续核验体系,那就是把自己变成了运营底座,成本结构会完全不同。

押情景 A 或 B:应用开发者不自建数据能力,专注场景,把底座当作基础设施用。这在两个情景下都是更经济的选择。

应当避免的错误:

避免让模型「补全」缺失字段。第一篇第 35 章「误判九」在应用层的版本:数据源没有的信息,模型不应该猜一个填上。猜出来的错误无法被用户识别。

避免用实时抓取的结果冒充核验过的数据。两者的价格不同、可靠性不同、责任不同,混用会在出事时无法解释。

六十六、工厂自己:被数据化的一方

最后一类主体,在三篇文章里一直是数据的对象,很少被当作行动者。但工厂自己在五年内也有可做的事。

无悔之举:

主动维护自己在公开渠道的信息。 官网、年报公示、招聘信息、展会资料——这些是三个情景下所有加工者的共同原料。一家工厂的公开信息越准确、越及时,它在任何数据产品里的画像就越接近真实。反过来,五年不更新的官网、填得极宽的经营范围、不公示的社保人数,会让它在数据里「看起来」比实际差。

准备一份可核验的能力档案。 设备清单、认证证书、主要客户类型、产能区间——不是宣传材料,是能被第三方核验的事实清单。情景 A 下它对接公共层的产业属性补充,情景 B 下它是底座核验的依据,情景 C 下它是模型抓取时最可靠的来源。跨境场景下,它就是「出海的数据身份」的自报部分。

了解自己的数据在哪里被用、怎么被用。 三个情景下,工厂的公开信息都会被加工、被调用、被模型组织成答案。工厂有权知道自己在数据产品里的画像是什么样的,并对错误提出异议——第一篇讨论合规时列出的「异议渠道」,对工厂同样适用。

情景押注:

押情景 A:主动配合公共层的数据汇聚——保证税务、社保、用电数据的准确申报——因为这些数据会成为金融机构与采购方判断自己的依据。

押情景 B:与一到两家商业底座建立核验关系,主动提供可核验的能力信息,换取在其数据产品中更准确的画像。

应当避免的错误:

避免「看起来更好」的过度包装。第二篇讲平台时代时说过,营销驱动的企业最显眼、制造驱动的企业最隐身;但五年后加工者的核验能力会显著提升,包装与事实的差距会被识别出来,代价是失去信任。

避免完全不管。「反正我不做推广」在五年后不再成立——工厂不出现在数据里,不等于不被评价,而是被评价为「信息不足」,在采购方与金融机构的筛选中直接落到最后。


五类主体的无悔之举有一条共同的底线:在所有情景下,都要让信息可追溯——来源、口径、时间、责任。 加工者披露它,买方要求它,政策规范它,开发者保留它,工厂维护它。这条底线不依赖任何一个情景成立,它是三个情景共同的地板。

六十七、买方的选型清单:十二个问题

第八部给买方的无悔之举里有一条「要求数据源披露口径与核验时间」。这一章把它展开成一份可以直接使用的清单——无论数据源来自公共层、商业底座还是模型,无论处于哪个情景,这十二个问题都适用。每个问题后面写明它对应哪一篇的哪个判断,读者可以回溯依据。

问题一:这条信息的口径是什么? 「工厂」按什么标准判定,「有外贸业务」是当年有报关还是历史上有迹象,「决策人」怎么定义。给不出口径的数据源,任何数字都不可比。(第一篇第 21 章)

问题二:这条信息最后一次核验是什么时候? 每个字段分别问。联系方式与产品线的核验时间,比统一社会信用代码的核验时间重要得多。(第一篇第 15 章、第 20 章)

问题三:这条信息能追溯到什么原始来源? 招聘、中标、专利、官网、年报——具体是哪一条。追溯不到的信息,与模型「补全」出来的信息无法区分。(第一篇第 19 章、第 35 章误判九)

问题四:准确率是分字段披露的还是一个总数? 总数没有意义。要分字段,并且要说明核验方法。(第一篇第 20 章)

问题五:有没有时序? 能不能告诉我这家企业的社保人数、招聘频率、经营状态在过去两三年里是怎么变的。没有时序的数据源只能回答状态,不能回答变化。(第一篇第 38 章、本文第四部)

问题六:矛盾的信号是怎么处理的? 工商存续但社保为零、招聘停了但官网还在——数据源是保留了矛盾还是按优先级消除了?保留矛盾的数据源信息量更大。(第一篇第 18 章)

问题七:计费单位是什么,失败怎么算? 按次、按席位还是一口价;调用失败、重复调用是否计费。计费规则本身反映了数据源对自己质量的信心。(第一篇第 23 章)

问题八:联系方式类字段的合规机制是什么? 脱敏、权限、审计、异议渠道是否齐全。缺任何一项,这个字段在五年内都有被下架的风险。(第一篇第 13 章、第 26 章,本文第四部)

问题九:接口的语义是否稳定? 字段会不会改名,错误有没有编码,返回结构有没有版本。这决定它能不能被嵌入自动化流程。(第一篇第 24 章,本文第二部变量七)

问题十:这个数据源在三个情景下各处于什么位置? 如果公共层开放,它会被替代还是会接入公共层?如果模型能力跃升,它的哪一部分会被吞掉?一个对自己的情景位置有清楚认识的数据源,比一个宣称「不受影响」的数据源更可信。(本文第三部)

问题十一:它能不能出具面向境外的画像? 如果业务涉及出口或境外客户的合规要求,数据源能不能提供不含个人信息、可被境外核验的企业档案。(本文第五部跨境一章)

问题十二:它公开过自己错在哪里吗? 一个从未公开纠错的数据源,要么从不出错,要么从不承认。前者不存在。(第二篇第三部「纸的极限」第五条,本文第九部)

十二个问题里,前四个是最低要求——回答不了就不该用;五到九是质量分级的依据;十到十二是面向五年的前瞻性要求。

这份清单也可以反过来用:数据源可以拿它自查。十二个问题都能回答的数据源,在三个情景下都有生存空间;能回答前四个的,至少不会犯第一篇列出的九个误判中的大多数。

六十八、现在该不该投入:一个决策框架

第八部的五类主体里,有一类会拿着本文问一个更直接的问题:我是一家有能力做产业数据的机构,2026 年现在,该不该投入?

本文不替任何人做决定,但可以给一个框架。它由三个问题组成,每个问题的答案都可以从前面各部找到依据。

问题一:你的时间视野有多长?

第七部那笔示意的账说明,一个通用底座在调用量达到日均几十万次之前,每年要承担数千万元量级的净投入,拐点最早也在 2028 年前后。如果你的资金和耐心撑不到 2029 年,通用底座不适合你——无论哪个情景,你都等不到回收。三年以内的视野,只适合做两件事:垂直加工(一个行业、一个字段,固定成本低一个数量级)或应用层(用别人的底座做场景产品)。

五年以上的视野,通用底座才进入选项。而且五年视野下,本文第四部的判断成立:时序积累是唯一无法追补的资产,晚三年开始就是永远少三年。

问题二:你要做的是哪一层?

第六部的分层组合把产业数据分成公共层、市场层、应用层。三层的处境完全不同:

  • 公共层不是市场机构能做的,它由授权运营机构承担,市场机构只能接入;
  • 市场层是本文反复分析的主战场,固定成本高、正外部性强、回收周期长,但五年后是最稳固的阵地;
  • 应用层门槛最低,依赖底座,竞争在场景理解上而不在数据上。

如果你的优势是行业知识(懂化工、懂机械、懂纺织),做市场层的垂直加工;如果你的优势是场景(有销售团队、有采购客户、有金融机构关系),做应用层;如果你两者都没有但有资本和耐心,通用底座是一个可以考虑但风险最高的选项。

问题三:你的价值能不能写成口径文档?

这是一个筛选性的问题。如果你打算做的事情能被写成一份口径文档——「我判定什么、依据什么、准确率多少、怎么核验、多久更新」——并且这份文档公开之后你的价值不会消失,那么你做的是加工,五年后有位置。如果你的价值在文档公开之后就没了——因为你的优势只是「别人不知道我怎么做的」——那你做的不是加工,是信息不对称套利,五年内会被口径披露的规范化淘汰。

三个问题合起来,可以得到几种典型的答案:

  • 视野短、有行业知识、价值可以写成文档 → 做一个行业的垂直加工,越早越好;
  • 视野短、有场景、价值在场景理解 → 做应用层,接一到两家底座,不自建数据;
  • 视野长、有资本、价值可以写成文档 → 通用底座是选项,但要按第八部数据加工者的四条无悔之举做,尤其是从第一天起保存快照;
  • 视野长、有资本、但价值写不成文档 → 不要做产业数据,做别的。

最后一条需要单独说。本文三篇反复强调的可追溯、口径、核验、责任,不是道德要求,是筛选机制——五年后它们会成为市场准入的默认条件,进不去的不是被监管淘汰,是被买方淘汰。第七部买方的十二个问题,就是那道门。

这个框架没有告诉任何人「该投」或「不该投」。它告诉的是:投入之前,先回答这三个问题;回答不了的,先不要投。

第九部 反向推演与证伪

情景规划有一个常用的补充技术:从假设的终点往回看,问「如果那件事发生了,回头看今天的哪些迹象会被视为起点」。它的用处是把抽象的情景变成具体的、今天就能检查的事实清单。本部对三个情景各做一次反向推演,然后列出本文的全部假设与证伪条件。

六十九、2031 年回看:如果公共底座成了

假设到 2031 年,主要省份的授权运营产品都提供企业经营活性判断,跨省互认,按调用量收费,商业加工者已经把经营状态判断切换到公共层、把资源集中在产业属性层。

从 2031 年回看,2026 年的哪些事会被视为起点?

「十五五」纲要里的那两句话。 「建立全国数据资源『一本账』」和「构建全国统一的数据产权登记体系」——2031 年的研究者会说,公共层的制度起点就在这里,尽管 2026 年时它们读起来只是原则性表述。

2025 年 1 月的价格形成机制文件。 「用于产业发展、行业发展的,可收取公共数据运营服务费」「可按数据调用量收费」「准许利润率按国债收益率加不超过 6 个百分点」——2031 年回看,这份文件为公共层定了价,只是当时没有人把它与企业活性产品联系起来。

某个省份 2026 年或 2027 年悄悄上线的一款企业活性产品。 它最初的用户只有本省几家银行,服务对象是普惠信贷,没有引起市场注意。2031 年回看,它是第一个样本。

2028 年可信数据空间里的某一个企业数据空间。 它把某省的税务、社保、电力数据与行业协会数据放进了同一个空间,证明了政企数据在企业层面可以合规地共用。

如果这四件事在 2031 年回看时都成立,那么情景 A 的起点在 2026 年就已经存在,只是当时看不清。反过来,如果 2028 年之后回看,这四件事里有两件以上没有发生,情景 A 在这个五年窗口内就没有起点。

七十、2031 年回看:如果运营底座成了

假设到 2031 年,两到三家商业运营底座成为大多数制造业智能体的默认数据源,按次调用摊薄了固定成本,口径文档被广泛引用,时序积累形成了后来者无法追补的壁垒。

从 2031 年回看,2026 年的起点是什么?

2024 年 11 月的 MCP 与 2026 年的接口化实践。 企业信息查询工具的 179 个原子能力、工厂数据平台的 MCP 与 REST 双门面——2031 年回看,这是数据产品从「给人看」转向「给机器调」的元年,尽管当时的调用量还很小。

某家底座在 2026 年前后公开的口径文档。 「什么算工厂、判定依据是哪些信号」——2031 年回看,它是事实标准的第一版,尽管当时没有人把它当作标准。

2026 年 1 月八部门文件里的「1000 个工业智能体」。 2031 年回看,这个目标制造了商业底座的需求拐点:智能体需要外部数据源,而它们不会各自去建。

某家底座从 2020 年代初开始按月保存的快照。 2031 年回看,这是壁垒的物理起点——十年时序,后来者补不上。

2026 年 2 月四部门意见里的「数据商」三个字。 2031 年回看,这是商业底座第一次获得制度身份。

如果这五件事在 2031 年回看时都成立,情景 B 的起点在 2026 年清晰可见。本文在第六部的观测清单里标注过,2026 年 9 月的读数偏向情景 B 的早期——这一章的反向推演给出了同样的结论,但也给出了它的脆弱之处:五件事里有三件(口径文档、快照积累、接口化)取决于商业机构自己做不做,不取决于外部环境。

七十一、2031 年回看:如果模型直采成了

假设到 2031 年,浅层和中等复杂度的企业信息查询已经由模型实时完成,专门的数据底座退缩到核验、时序、审计三件事上,市场规模显著缩小。

从 2031 年回看,2026 年的起点是什么?

斯坦福 AI Index 的那条曲线。 两年 280 倍的推理成本降幅——2031 年回看,这条曲线的延续让「每次任务扫描上千网页」变得经济可行。

2026 年主流模型客户端里刚刚出现的「深度检索」类功能。 当时它们只能读几十个网页,结果一致性一般,但已经能回答「这家企业做什么」。2031 年回看,这是起点。

某家模型厂商在 2027 年前后推出的企业信息内置工具。 它绕过了第三方数据源,最初只覆盖上市公司和大企业。2031 年回看,它是模型直采的第一个产品形态。

司法对模型实时抓取的态度。 如果 2027 年到 2028 年之间出现了判例,认定模型智能体为回答用户问题而实时读取企业公开网页属于合理使用,情景 C 的法律障碍就消除了一大半。2031 年回看,这个判例是关键。

如果这四件事都成立,情景 C 的主体部分在五年内发生了。但本文第三部给出的五条理由——一致性、成本量级差、反爬与合规、核验无法实时、责任——在 2031 年回看时也需要逐条检验:它们是被技术进步消解了,还是仍然成立?本文的判断是至少后三条仍然成立,因此情景 C 会部分发生而不会完整发生。这个判断的证伪条件在下一章。

七十二、本文的假设清单

本文的全部推演建立在以下假设之上。它们在第一部被写成「基线」,这里把它们改写成可以被逐条否定的形式。

假设一:「十五五」期间数据要素市场化的政策方向不逆转。 三权分置、登记体系、一体化市场、数据商培育,继续推进而不是收回。

假设二:大模型推理成本继续以数量级下降。 五年内至少再降一个数量级。

假设三:制造业主体的数量维持在数百万量级。 不出现使主体数量下降一半或翻倍的结构性冲击。

假设四:合规的方向是企业公开信息开放、个人信息收紧。 不出现对企业公开信息加工的全面限制,也不出现对个人信息处理的全面放开。

假设五:智能体的普及按既定目标推进。 2027 年普及率超过 70% 的目标至少大致接近,面向制造业的智能体大量出现。

假设六:没有本文无法从现有事实推出的技术突破。 本文的规则一——只推演由已发生事实驱动的分叉——意味着如果出现一种今天完全看不到迹象的技术,本文的推演框架失效。

假设七:五年内不发生使供应链信息需求大幅萎缩的宏观冲击。 需求侧的三个确定量(外贸主体、智能体目标、高质量数据集)建立在制造业与贸易活动大致延续当前规模的前提上。

七条假设中,一、三、四、七的把握度较高;二、五的把握度中等;六是方法论上的自我限定。

七十三、什么会证伪本文

把三个情景的证伪条件与七条假设合并,得到本文整体的证伪清单。以下任一情况出现,本文的核心判断——「加工不会被取消,会被分层」——需要重新审视。

证伪一:三个情景的必要信号在 2029 年前一个都没有出现。 公共层没有企业活性产品,商业底座没有调用量拐点,模型没有跨过可读网页量的阈值。这意味着五年内工厂数据的形态与 2026 年基本相同,本文的分层推演过于乐观。

证伪二:情景 C 完整发生。 到 2029 年,主流模型在全量筛选任务上的准确率与一致性达到商业底座水平,单次任务成本降到接口调用同一量级,且司法明确允许模型实时大规模抓取。这意味着本文对情景 C 的「不会完整发生」判断错误,加工层被吸收而不是分层。

证伪三:公共层延伸到了产业属性。 如果政府部门开始采集企业的产品与工艺信息,并通过公共层提供,那么本文「产能是市场层唯一稳固阵地」的判断错误,市场层的空间会比本文推演的小得多。本文认为这件事发生的可能性很低——没有任何政府部门有采集产品信息的职能与动力——但它在逻辑上是可能的。

证伪四:口径在五年内实现了国家标准层面的统一。 本文认为不会——产业属性的判定与用途强相关,统一标准难以覆盖所有用途。如果全国数标委在 2029 年前发布了「企业生产活动判定」类国家标准并被广泛采用,本文对变量五的判断错误,情景 B 的「事实标准」路径会被替代。

证伪五:个人信息处理规则收紧到「人」这一格无法作为商业产品存在。 本文认为五年后这一格仍然是商业产品,只是形态更保守。如果国内出台规则明确禁止任何形式的企业联系人信息商业化处理,本文第四部对这一格的推演错误。

证伪六:假设一到假设七中的任何一条被推翻。

六条证伪条件里,本文认为最需要盯住的是证伪二——它是三个情景中对现有市场结构冲击最大的一条,也是本文作者立场最可能影响判断的一条。读者在检验本文时,应当对这一条给予额外的怀疑。


反向推演与证伪清单到此结束。本文没有给出概率,但给出了三组起点、七条假设、六条证伪条件。五年后,读者可以拿着这份清单逐条核对,看本文在 2026 年 9 月的判断有几条对了、几条错了、错在哪一条假设上。

这就是推演与预测的区别:预测在五年后只能被说「对」或「错」;推演在五年后可以被说「错在这里」。后者更有用。

七十四、十个可能的反驳与回应

一篇推演如果不预先回答它最可能遇到的反驳,就没有做完。以下十条反驳是本文在写作过程中自己提出、并尽量诚实回应的。回应不是要驳倒反驳,而是说明本文在哪些条件下会同意它。

反驳一:「政府永远不会把税务、社保、用电数据开放给市场。」

回应:本文没有假设原始数据开放。情景 A 假设的是「经过脱敏与聚合的经营状态判断」以授权运营产品的形式提供——比如三档的经营活性等级,而不是用电曲线本身。这种粒度的产品在 2026 年的制度框架下已经可以做,金融机构已经在用。反驳成立的条件是:连聚合后的判断也不开放。如果到 2028 年底仍是如此,情景 A 关闭,本文第六部已经把它列为证伪条件。

反驳二:「模型明年就能做全量筛选,情景 C 会很快完整发生。」

回应:本文第三部给了五条理由说明为什么不会完整发生,其中三条(核验无法实时、时序无法追补、责任无法归属)不依赖模型能力。如果反驳成立——2029 年前模型在全量筛选上达到底座水平、成本同量级、司法允许——本文的证伪二被触发,本文会承认判断错误。本文也在序章说明了作者立场可能影响这一判断,请读者对这一条额外怀疑。

反驳三:「按次 0.1 元太便宜,养不活任何底座。」

回应:第七部那笔示意的账正是回答这一条。按假设的成本区间,覆盖年成本需要日均几十万到百余万次调用,而需求侧的可能区间是日均十万到千万次。拐点是可能的,不是必然的。反驳成立的条件是调用量长期停在日均十万次以下,那就是第四个情景「停滞」。

反驳四:「口径披露会泄露商业秘密,没有底座会真的公开。」

回应:口径文档披露的是「什么算工厂、依据哪些信号、置信度怎么分级」,不是信号的具体权重和算法。前者是使用者判断数据可不可用的前提,后者才是商业秘密。第二篇讲的普查公报就是先例——它公开了口径与方法,没有公开每一张表。反驳成立的条件是市场把「口径」与「算法」混为一谈,那样口径披露会被抵制,变量五的判断就要修正。

反驳五:「工厂根本不想被数据化,它们会抵制。」

回应:工厂的公开信息本来就是公开的——招聘、中标、专利、年报都是它们自己发布的。数据化不是把不公开的变公开,而是把公开的组织起来。第八部给工厂的建议正是基于这一点:与其被动被组织,不如主动维护。反驳成立的条件是工厂大规模停止发布公开信息,这在需要招人、投标、申报的现实里不太可能。

反驳六:「公共层一旦出现,商业底座就没有存在的必要了。」

回应:公共层只能回答政府部门有数据的那些问题——是否在经营、规模多大。「在造什么、工艺如何、产业带归属、谁能拍板」不在任何部门的采集范围内。第四部逐字段分析过,产能、分类、人、时间四格留在市场层。反驳成立的条件是政府开始采集产品与工艺信息——本文的证伪三,本文认为可能性很低。

反驳七:「五年太短,什么都看不出来。」

回应:五年内有三个硬性的到期节点(2026 年底、2027 年、2028 年)和二十个可观测信号。本文不要求五年内出现最终结果,只要求五年内能看出方向。第九部的复核方法就是为此设计的。如果五年后二十个信号一个都没动,那本身就是一个结果——停滞情景。

反驳八:「本文作者是从业者,推演偏向自己。」

回应:是。序章已经写明。本文的应对是三条规则加一个完整的对手情景(情景 C)加一条专门针对自身立场的证伪条件(证伪二)。读者可以据此折扣本文的判断,但本文希望折扣的是判断,不是方法——方法是可以被任何立场的人拿去重做的。

反驳九:「情景分析只是把不确定性包装成了确定性。」

回应:这是对情景分析最常见的批评,也常常是对的。本文的防御是规则三——不给概率——和第九部的假设清单。本文给的每一个判断都附带了「在什么条件下成立」,读者可以只接受条件而不接受结论。如果本文在某处给出了没有条件的结论,那是本文的失误,应当被指出。

反驳十:「三篇加起来十五万字,太长了。」

回应:这一条反驳成立。三篇文章各自五万字,是为了把一个问题从三个方向都讲透——2026 年的地基、一百二十年的历史、五年的岔路——而不是为了长。但长度本身是一种成本,读者付出的时间是真实的。本文能做的补偿是:每一部都可以独立阅读,每一章都有明确的结论,第九部的清单可以脱离正文单独使用。如果读者只读一页,请读第六部的二十个信号。

十条反驳里,本文完全同意第十条,部分同意第八、九条,有条件地同意第一到七条。同意的条件都写在回应里,五年后可以逐条核对。

七十五、如何每半年复核本文

本文的价值不在它今天说了什么,而在它五年内能被逐条核对。这一章给出一套复核的方法,任何读者都可以独立执行。

第一步:拉出观测清单。 第六部的二十个信号,按情景分组。每半年过一遍,对每个信号标注四种状态之一:已出现、有迹象、无变化、出现相反迹象。

第二步:查证的来源。 二十个信号各有可查的公开来源:

  • 信号 1 到 6(情景 A):国家数据局官网的政策发布与新闻,各省数据局或公共数据授权运营机构公布的产品目录与收费标准,可信数据空间的建设名单;
  • 信号 7 到 12(情景 B):主流模型客户端与智能体开发框架的工具目录更新说明,商业数据平台公开的价格页与口径文档,数据商培育相关政策文件,商业底座的年度披露;
  • 信号 13 到 17(情景 C):模型厂商的产品更新日志中关于检索能力的说明,第三方对模型检索能力的评测,法院公开的数据抓取类判决文书;
  • 信号 18 到 20(横切):全国数据标准化技术委员会的标准立项公告,网信部门与市场监管部门的执法通报,财政部关于数据资源会计处理的后续文件。

所有来源都是公开的。复核不需要任何内部信息。

第三步:记录读数。 把每次复核的结果记成一行:日期、每个信号的状态、当期新增的重要事件。半年一行,五年十行。十行读完,三个情景的实际份额就清楚了。

第四步:对照假设清单。 第九部的七条假设,每次复核时检查是否有被推翻的迹象。假设被推翻的影响比信号变化更大——它意味着推演的地基变了,而不只是路径变了。

第五步:对照证伪条件。 第九部的六条证伪条件,任何一条被触发,本文的核心判断就需要重新审视。尤其是证伪二(情景 C 完整发生),它是本文作者立场最可能影响判断的一条。

第六步:与前两篇对照。 本系列第一篇的「九个常见误判」和第二篇的「六个时代」提供了另外两个检验角度:五年后的数据产品有没有犯第一篇列出的那九种错误?五年后的信息组织方式,是第二篇六个时代中哪一个的延续?这两个问题的答案,与本文三个情景的读数应当是一致的——如果不一致,说明三篇文章之间有一篇错了。

关于本文自身的更新。 本文在发布时已经写明了 2026 年 9 月的读数:二十个信号中三个有初步迹象,其余尚未出现,偏向情景 B 早期。本文建议的复核节奏是每半年一次。如果读数出现实质变化,本文应当被修订而不是被替换——保留原始判断,附上后续读数,让读者看见推演与现实的差距是怎样逐步显现的。

一份可以被逐条核对、并且愿意公开自己错在哪里的推演,比一份只能事后被说「对」或「错」的预测,对读者更有用。这是本文写作方法的最后一条,也是本系列三篇文章共同的态度。

结语:五年后该盯着什么看

本文推演了五年,写了三个情景、七个变量、八个字段、三个场景、五类主体、二十个信号、七条假设、六条证伪条件。把这些全部压缩,剩下三句话。

第一句:加工不会被取消,会被分层。 经营状态可能归公共层,产业属性留在市场层,浅层查询归模型。每一层都有自己的加工者,每一层都有自己的买单方式。第一公里没有消失,它被分成了三段,每一段都比 2026 年更清楚该由谁走、怎么收费、对什么负责。

第二句:三个情景的分水岭在「身份」与「时间」两格。 经营状态判断能不能由公共数据回答,决定了公共层与商业层的边界;时序积累有没有,决定了底座与工具的边界。五年后产业数据的竞争,不在覆盖,不在判定,在这两格。

第三句:可信度是唯一不能靠技术突破的边界。 第二篇讲一百二十年时说,每一代人的工具都比上一代好,每一代人都以为工具够了;本文推演五年时说,模型会把获取的成本压到接近于零,但获取不等于可信。核验、口径、追溯、责任——这四件事在三个情景下都不会被技术替代,它们是运营,不是技术。

三篇文章到此结束。第一篇解剖了 2026 年的地基,第二篇回溯了一百二十年的组织史,本文推演了五年的岔路。三篇的立场从头到尾只有一个:产业数据是一项被反复求解、并且还将继续被求解的公共工程;它需要的不是一次性的突破,而是一代一代人持续的支付。

五年后,本文的判断会被检验。清单已经列好了。读者只需要每半年拿出来对一次——看信号,看假设,看证伪条件——就能知道这条路走到了哪里,以及本文错在了哪里。

一个国家怎么知道自己有多少家工厂、在哪里、造什么。这个问题从 1931 年那份二十五项的附表提出到今天,九十五年了。本文不认为它会在 2031 年被回答完。本文认为,到 2031 年,回答它的人会比今天更清楚自己在做什么。

这就够了。


附录一:三篇的接口

「工厂数据」系列三篇各用一种文体、一个时间尺度,但它们讨论的是同一个对象。这份附录把三篇的核心框架对齐,方便读者跨篇使用。

三个时间尺度。 第一篇是 2026 年的截面(解剖),第二篇是 1902 年到 2026 年的纵向(编年),本文是 2026 年到 2031 年的前瞻(推演)。三个尺度共用一个起点——2026 年——第一篇描述它,第二篇解释它怎么来的,本文推演它往哪去。

三组框架的对应。

第一篇:八个字段 第二篇:六个时代 本文:三个情景
名字(实体对齐) 认脸时代的熟人网络;三线的代号 三情景下趋于解决
身份(法律与经营状态) 公示时代的一照一码 情景 A 与 B 的分水岭
分类(口径) 目录时代的产品目录;1382 个小类 口径披露成规范,不统一
规模 年报制度创造的社保人数字段 情景 A 下用电量登场
产能 1944 年名录把「各大工厂」列第一类 市场层唯一稳固阵地
人 供销员的名片盒;电话普及曲线 合规决定形态
位置 广交会一个展馆;产业带 从点到面
时间 每一代人停止投入信息就失效 底座与工具的分界

三个共同的判断。 三篇文章在不同的尺度上得出了同一组结论,这是它们互相验证的方式:

  • 第一篇说「加工是前置的、重资产的、正外部性强的投入,现有制度激励没有落在它上面」;第二篇说「工厂信息的组织从来不是可以完成的工程,而是必须持续支付的运营」;本文说「加工不会被取消,会被分层,每一层都需要有人持续走」。三句话是同一个判断。
  • 第一篇说「每个数字都必须挂一个口径」;第二篇用一百二十年的十个数字证明了口径从来没有统一过;本文推演五年内也不会统一,但披露会成为规范。
  • 第一篇说「错误数据经过模型会被放大」;第二篇说「一百二十年的技术进步解决的是获取,可信从来靠人核」;本文说「可信度是唯一不能靠技术突破的边界」。

三篇的使用方式。 要理解一个具体的数据字段为什么难,读第一篇;要理解今天的形态是怎么形成的、哪些问题是老问题,读第二篇;要判断该往哪个方向投入、五年内盯什么,读本文。三篇可以按任意顺序读,但按发布顺序读,逻辑最连贯。

附录二:术语与口径表

三篇文章反复使用的术语,在此统一定义。带口径的数字标注来源与时点。

  • 工厂 / 工厂档案:本系列指经多源硬信号判定具有实际生产活动的经营主体档案,不以登记行业门类为唯一依据,包含企业法人与个体工商户等形态。天下工厂产业平台口径 480 万家(2026 年)。
  • 制造业法人单位:第五次全国经济普查口径,登记行业门类为制造业的法人单位。2023 年末 404.9 万个;第四次普查 2018 年末 327.0 万个。
  • 制造业企业:全国组织机构统一社会信用代码数据服务中心口径,登记行业门类为制造业的企业。2025 年 5 月末 246 万家。
  • 规模以上工业企业:国家统计局口径,年主营业务收入 2000 万元及以上的工业法人单位。2025 年末约 43.6 万家。
  • 有进出口记录的经营主体:海关总署口径,当年有实际报关记录的主体,含纯贸易主体。2025 年超过 78 万家。
  • 有外贸业务迹象的工厂:平台口径,存在历史报关、外文站点、跨境平台经营、境外展会等迹象的工厂档案,不要求当年报关。108 万家。
  • 决策人直连联系方式:平台口径,带有采购、生产、技术负责人或企业主直线联系方式的工厂档案,脱敏存储、按权限解锁。超过 300 万家。
  • 硬信号 / 软信号:硬信号指伪造成本高于伪造收益、与待判断事实强相关的信息(招聘、中标、许可、专利、展会);软信号指可零成本声明或弱相关的信息(经营范围、名称、自述)。
  • 实体对齐:判断两条记录是否指向同一现实主体的过程;带统一社会信用代码的记录可精确匹配,不带的需规则与多特征联合判定。
  • 口径:一个数字的统计对象、时间点或时间窗、判定标准三要素的组合。缺任何一项,数字不可比。
  • 伪精度:给出的精确程度超过其依据所能支撑的程度,如对判定类结果报出精确到个位的总数。
  • 公共层 / 市场层 / 应用层:本文对未来产业数据分层的命名。公共层指基于政府多部门数据的经营状态判断(情景 A);市场层指商业加工的产业属性(产能、分类、人、时序);应用层指面向具体场景的组合产品。
  • 运营底座:本文对持续投入核验、以接口按次提供、公开口径文档的商业产业数据机构的称呼(情景 B)。
  • 模型直采:模型智能体在任务时实时抓取公开信息并自行判定,不经预加工底座(情景 C)。
  • 三权分置:数据资源持有权、数据加工使用权、数据产品经营权的分离,出自 2022 年 12 月「数据二十条」。
  • 数据商:2026 年 2 月四部门意见中数据流通服务机构三类之一,与数据交易所(中心)、数据流通服务平台企业并列。
  • 准许收入:公共数据授权运营价格形成机制中的概念,等于经营成本加准许利润,准许利润率按 10 年期国债平均收益率加不超过 6 个百分点核定。
  • 可信数据空间:基于共识规则、联接多方主体、实现数据资源共享共用的数据流通利用基础设施;2028 年目标建成 100 个以上。
  • 高质量数据集:经采集、加工等处理,可直接用于开发和训练人工智能模型的数据集合;截至 2026 年 8 月建成超过 12.6 万个、1815 PB。
  • MCP:模型上下文协议,2024 年 11 月提出,规范大模型与外部数据、工具之间的调用行为。
  • 活动链:欧盟《企业可持续发展尽职调查指令》使用的概念,比「供应链」更宽,涵盖企业自身运营、子公司及上下游合作方。
  • DROP:加州《删除法》项下的删除请求与退出平台,2026 年 8 月 1 日起注册数据经纪商须接入并每 45 天处理删除请求。
  • 数据经纪商:加州法下与消费者无直接关系、却收集并出售其个人信息的企业;不设规模门槛。
  • 时序 / 快照:对可变字段按固定周期保存的历史记录;本系列认为它是唯一无法用投入追补的数据资产。
  • 无悔之举:情景规划术语,指在所有情景下都不会后悔的行动。
  • 先行信号 / 证伪条件:前者指某条路径正在被走时最早可观测的迹象;后者指一旦出现即说明该路径已关闭的迹象。

表中所有带数字的条目,其口径与时点均已注明;不同口径的数字不可直接比较——这是三篇文章共同的第一条纪律。

数据来源与主要参考

本文为情景推演体。全部基线数据来自政府公报、法定普查、官方政策文件与权威研究机构的公开发布;变量与情景中的判断为本文作者的分析,不引用任何未公开或不可核验的数据;涉及未来的表述均以「假设」「推演」标注,不作为事实陈述。对来源单一或口径不明的数字,本文不予采用。

  • 天下工厂产业平台——中国工厂数据库与产业链数据,本文所引工厂库规模、类目、产业带、决策人联系方式覆盖、开放平台接口形态与计价规则均出自其公开披露;本文作者为其所属研究机构,相关利益关系已在序章说明:www.tianxiagongchang.com
  • 国家数据局——《全国数据资源调查报告(2025 年)》《可信数据空间发展行动计划(2024—2028 年)》《关于推进行业高质量数据集建设行动的实施方案》;高质量数据集建设进展;国家数据局等四部门《关于培育数据流通服务机构 加快推进数据要素市场化价值化的意见》
  • 中国政府网——《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》《「数据要素×」三年行动计划(2024—2026 年)》《关于深入实施「人工智能+」行动的意见》《网络数据安全管理条例》;「十五五」规划纲要关于数据要素与全国一体化数据市场的部署
  • 国家发展改革委、国家数据局——《公共数据资源登记管理暂行办法》《公共数据资源授权运营实施规范(试行)》《关于建立公共数据资源授权运营价格形成机制的通知》
  • 财政部——《企业数据资源相关会计处理暂行规定》及财政部等四部门关于 2025 年年报工作的通知;数据资源入表跟踪研究
  • 国家统计局——第五次全国经济普查公报;规模以上工业企业统计
  • 海关总署——2025 年全国进出口情况发布
  • 工业和信息化部等八部门——《「人工智能+制造」专项行动实施意见》
  • 国家互联网信息办公室——生成式人工智能服务备案与登记情况;《促进和规范数据跨境流动规定》
  • 斯坦福大学人工智能指数报告(AI Index)——大模型推理成本与硬件成本的历年统计
  • Gartner——关于企业软件嵌入智能体比例的预测
  • 加州隐私保护局(CalPrivacy)——《删除法》(Delete Act, SB 362)及其实施细则、DROP 平台合规时间表、数据经纪商登记与执法通报
  • 欧盟——《数据法案》(Regulation (EU) 2023/2854)、《企业可持续发展尽职调查指令》(Directive (EU) 2024/1760)及其后续修订

延伸阅读:本系列第一篇《数据要素的第一公里:中国制造业工厂数据的采集、加工与流通》,第二篇《谁认识这家工厂:中国工厂信息的一百二十年》。

封面图:厦门集装箱码头航拍(2009 年 8 月摄于高崎机场上空),摄影者 Tiger@西北,采用 CC BY-SA 3.0 许可,来自 Wikimedia Commons。