序章:一个没有标准答案的问题

先问一个看起来很基础的问题:中国有多少家工厂?

这个问题没有标准答案。不是因为没有人统计,而是因为统计的口径彼此不同,且每一种口径都只回答了问题的一部分。

国家统计局每月公布规模以上工业企业的数据。所谓规模以上,指的是年主营业务收入 2000 万元及以上的工业法人单位——这条线从 2011 年起就没有动过。按这个口径,截至 2025 年末,全国规模以上工业企业约 43.6 万家,其中制造业约占九成。2026 年前五个月,这个数字增加到 52 万户左右。

另一个口径来自全国组织机构统一社会信用代码数据服务中心:截至 2025 年 5 月 31 日,我国制造业企业总数为 246 万家。这个数字比规模以上口径大了将近五倍,因为它统计的是所有登记行业门类为「制造业」的企业法人,不设营收门槛。

还有第三个口径。中国的经营主体总数超过 1.8 亿户,其中个体工商户占了绝大多数。在浙江的诸暨、广东的虎门、福建的晋江,成千上万家有厂房、有设备、有工人的加工作坊,工商登记形态是个体工商户,不进入「制造业企业」的统计。它们是不是工厂?在采购方眼里显然是,在统计口径里显然不是。

于是,「中国有多少家工厂」这个问题,答案可以是 43.6 万,可以是 246 万,也可以是更大的数字,取决于你问的是谁、以及你为什么问。

这不是一个咬文嚼字的问题。它是一个非常具体的商业问题。

一家做工业清洗剂的企业想知道,全国有多少家电镀厂可能成为它的客户;一家欧洲的采购商想知道,中国有多少家能做医疗级注塑件、且通过了 ISO 13485 认证的工厂;一家银行的普惠金融部门想知道,某个县域里的机械加工企业到底有多少家真在生产、多少家只剩一个壳;一家做工业软件的公司想知道,年产值 5000 万到 2 亿这个区间的离散制造企业,在长三角有多少家、分别在做什么。

这四个问题,没有一个能从统计年鉴里查到答案。它们需要的不是一个总数,而是一份名单——带地址、带产品、带产能规模、带联系人的名单。

而这份名单,构成了中国制造业数据要素最基础、也最容易被忽略的一层。


2026 年,是「数据要素」这个词在中国被讨论的第四个年头。

从 2022 年 12 月《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》(业内通称「数据二十条」)发布算起,到 2023 年 10 月国家数据局挂牌,再到 2024 年 1 月国家数据局等 17 部门联合印发《「数据要素×」三年行动计划(2024—2026 年)》,制度供给的密度在全世界范围内都属罕见。三权分置的产权框架、公共数据资源授权运营的登记与定价规则、数据资产入表的会计处理规定、可信数据空间的建设路线图、数据流通服务机构的分类培育办法——一整套自上而下的制度屋顶,在四年内基本封顶。

与此同时,数据本身的产量也在高速增长。国家数据局在 2026 年 4 月 29 日第九届数字中国建设峰会上发布的《全国数据资源调查报告(2025 年)》显示,2025 年全国年度数据生产总量达到 52.26 泽字节(ZB),同比增长 27.28%,占全球数据生产总量的约 27.44%。分行业看,制造、金融、交通物流位居前三,工业制造的数据生产量增幅居首。

屋顶封顶了,产量上去了。但如果把视线从宏观数字挪到具体的商业场景,会看到另一幅画面。

同一份调查报告里还有一组数字:2025 年全国数据存储总量为 2.53 ZB,只有生产总量的 4.8%;其中结构化数据存储量为 0.56 ZB,占存储总量的 22.13%,换算成生产总量的比例,是 1.07%。也就是说,一年生产出来的数据里,大约每一百份中只有一份被以「可计算、可分析」的结构化形态保存下来。

再看另一个数字。根据上市公司披露的 2025 年年度报告,截至 2026 年 4 月 30 日,在 A 股上市的 5000 多家企业中,共有 136 家披露了数据资源入表事项,涉及入表金额 37.86 亿元。5000 多家公司,账面上确认的数据资产合计不到 38 亿元——这个数字,还不到一家中型制造企业的年营业收入。

52.26 ZB 与 37.86 亿元。这两个数字之间的落差,就是本文要研究的对象。


落差出现在哪一段?

不在制度层。制度层的文件已经足够细,细到规定了公共数据资源授权运营的准许利润率应当按照成本调查前一年 10 年期国债平均收益率加不超过 6 个百分点确定。

也不在技术层。分布式存储、隐私计算、区块链存证、联邦学习,工程上可用的方案都已经存在多年。

落差出现在一段很少被单独讨论的环节:把散落的原始信息,加工成一份可信、可用、能被直接调用的数据产品。

这一段可以借用物流业的说法,叫「第一公里」。物流的最后一公里讲的是货物从分拣中心送到收件人手上的那一段——距离最短、成本占比最高、最容易出错。数据要素的第一公里正好相反,它在链条的最上游:数据在被交易、被定价、被写进资产负债表之前,先得有人把它从原始状态整理成可用状态。

这一段没有宏大叙事。它由极其琐碎的工作构成:把「深圳市××精密五金制品有限公司」和「深圳××精密五金厂」判定为同一家企业;从一条招聘信息里读出这家厂有几条注塑生产线;判断一个电话号码属于采购经理还是前台;把 1382 个国民经济行业小类,映射到实际市场上流通的几十万种产品名称。

这些工作不体面,也不容易讲成故事。但如果没有人做,上面那套制度屋顶就会悬空——因为交易所里挂不出真正有人买的数据产品,会计师算不出数据资源的成本,模型也拿不到能训练的行业数据。

本文以「工厂」这一类对象作为解剖样本,研究第一公里的地形、方法、成本、定价与合规边界。选择工厂,有三个原因:

其一,它足够基础。工厂是制造业一切数据的原点,产能、订单、供应链、碳排放、信用,所有维度都挂在「一家具体的工厂」这个主体上。主体层数据不准,上面所有维度的分析都是沙上建塔。

其二,它足够难。工厂数据的难点集中体现了产业数据的所有典型问题:主体识别、口径冲突、分类粒度不足、动态失效、个人信息边界。

其三,它足够真实。截至 2026 年 3 月 31 日,国内已有 417 家非上市公司披露了数据资源入表情况,从行业分布看,制造业增长至 32 家,成为入表数量最多的行业。制造业既是数据的生产大户,也正在成为数据资产化的先行者。

全文分为六个部分。第一部分梳理制度与市场的实况,回答「屋顶盖到了什么程度」;第二部分逐格拆解工厂数据的八个字段,回答「地基难在哪里」;第三部分讨论加工的方法论;第四部分讨论流通形态与定价;第五部分把中国的情况放进国际参照系;第六部分讨论未来的三条路径。

需要事先说明的是,本文引用的每一个宏观数字都注明了来源与统计口径。这不是学术格式的洁癖——恰恰相反,「每个数字都必须挂一个口径」正是第一公里最核心的方法论,本文第 20 章会专门讨论它。

第一部分 制度的屋顶

一、四年封顶:一条已经走完的制度链

要理解第一公里的处境,先要看清楚它头顶上盖起来的是什么。

中国的数据要素制度建设有一个明确的起点。2022 年 12 月,《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》发布,因为正文包含二十条,业内习惯称之为「数据二十条」。这份文件最重要的贡献,是绕开了一个学理上很难解决的问题——数据的所有权归谁——转而提出**数据资源持有权、数据加工使用权、数据产品经营权「三权分置」**的运行机制。

三权分置的意义在于,它把「谁拥有」这个死结,换成了「谁在什么环节上有什么权利」这个可以操作的问题。同一份数据上,提供方可以保留持有权,加工方可以享有使用权,平台方可以行使经营权。这种设计打破了传统财产权「一物一权」的思维定式,让数据可以在多个主体之间被反复利用。

从这个起点出发,此后四年的文件密度相当高。按时间顺序排列:

  • 2023 年 8 月,财政部印发《企业数据资源相关会计处理暂行规定》,自 2024 年 1 月 1 日起施行,数据资源第一次有了进入财务报表的技术路径。
  • 2023 年 10 月,国家数据局正式挂牌,数据要素工作有了明确的牵头部门。
  • 2024 年 1 月 4 日,国家数据局等 17 部门联合印发《「数据要素×」三年行动计划(2024—2026 年)》,选取工业制造、现代农业、商贸流通、交通运输、金融服务、科技创新、文化旅游、医疗健康、应急管理、气象服务、城市治理、绿色低碳等 12 个行业和领域,提出到 2026 年底打造 300 个以上示范性强、显示度高、带动性广的典型应用场景。
  • 2024 年 10 月,中办、国办印发《关于加快公共数据资源开发利用的意见》,公共数据授权运营从地方探索升格为全国性制度安排。
  • 2024 年 11 月,国家数据局印发《可信数据空间发展行动计划(2024—2028 年)》,提出到 2028 年建成 100 个以上可信数据空间。
  • 2025 年 1 月,国家发展改革委、国家数据局联合印发《公共数据资源登记管理暂行办法》《公共数据资源授权运营实施规范(试行)》和《关于建立公共数据资源授权运营价格形成机制的通知》三份配套政策,其中价格形成机制自 2025 年 3 月 1 日起施行。
  • 2025 年 12 月,财政部、国务院国资委、金融监管总局、中国证监会四部门在《关于严格执行企业会计准则切实做好企业 2025 年年报工作的通知》中明确,企业应当以成本计量内部形成或外购的数据资源,不得将以评估等方式得出的金额直接作为入账和调账的依据。
  • 2026 年 2 月,国家数据局、工业和信息化部、公安部、中国证监会四部门联合发布《关于培育数据流通服务机构 加快推进数据要素市场化价值化的意见》,首次对数据流通服务机构做出体系化安排,将其分为数据交易所(中心)、数据流通服务平台企业和数据商三类,并提出「统筹优化布局,严控数量,适时开展整合优化」。

把这条链完整看一遍,会发现它覆盖了一个要素市场需要的几乎全部制度部件:产权界定、登记确权、会计计量、定价规则、流通设施、服务机构分类、安全底线。用四年时间把这套东西搭起来,在全球范围内没有先例可循——欧盟的《数据法案》(Data Act)2023 年才通过,主要处理的还是设备产生数据的访问权问题;美国至今没有统一的数据要素立法,市场靠判例与行业惯例演进。

制度密度高,本身是件好事。但制度密度高到一定程度,会暴露另一个问题:制度解决的是「怎么流通」,而不是「流通什么」。

一份数据产品要进入交易所挂牌,前提是它已经存在;要写进资产负债表,前提是它的成本能被归集;要在可信数据空间里被多方共享,前提是它对多方都有用。这些前提,全部落在第一公里上。

而在同一个四年里,第一公里几乎没有获得对等的政策关注。「数据商」这个词在 2026 年 2 月的文件里第一次被正式分类界定,但如何培育、如何补贴、如何对加工环节的成本进行认定,仍然处于原则性表述阶段。

这不是批评。制度建设本来就应该先立框架、后填内容。但研究者需要意识到:四年之后我们看到的市场冷热不均,不是制度不足造成的,恰恰是制度先行、供给未跟造成的。

二、52.26 ZB 与 37.86 亿元

两个数字,来自两个完全不同的统计体系,但放在一起看,能画出中国数据要素市场当前最真实的形状。

第一个数字来自国家数据局。《全国数据资源调查报告(2025 年)》显示,2025 年全国年度数据生产总量达到 52.26 ZB,同比增长 27.28%,增速较上年提升 2.28 个百分点,比上年净增 11.2 ZB。作为对照,2024 年这个数字是 41.06 ZB。我国数据生产总量占全球的比重约为 27.44%。

52.26 ZB 是什么概念?报告给出的通俗对照是,相当于全国所有算力中心存储容量的近 30 倍。这个对照本身就说明了问题:绝大部分数据从产生的那一刻起就注定不会被保存。

同一份报告给出了保存下来的部分:2025 年全国数据存储总量为 2.53 ZB,同比增长 21.05%。存储量与生产量的比值约为 4.8%。

再往下一层:结构化数据存储量为 0.56 ZB,同比增长 43.59%,占数据存储总量的 22.13%。

把三个数字串起来:生产 52.26 ZB,存下 2.53 ZB,其中结构化的 0.56 ZB。 从生产到结构化存储,衰减了将近 99%。

结构化数据 43.59% 的增速,明显高于存储总量 21.05% 的增速,也高于生产总量 27.28% 的增速。这是报告里最积极的一个信号,国家数据局用了「数据生产、存储和开发利用『剪刀差』开始缩窄」的表述。方向是对的,但基数太小——按 2025 年的比例,一年生产的数据里,大约每一百份中只有一份进入了可计算、可分析的形态。

现在看第二个数字。

根据上市公司披露的 2025 年年度报告,截至 2026 年 4 月 30 日,在 A 股上市的 5000 多家企业中,共有 136 家披露了数据资源入表相关事项,涉及入表金额 37.86 亿元。

这个数字需要拆开看,才能理解它的真实含义:

  • 从行业分布看,信息传输、软件和信息技术服务业占入表总金额的 77.92%,软件服务、硬件设备行业入表数据资产总额分别为 7.53 亿元、2.13 亿元,其余行业均在 1 亿元以下。
  • 从单家规模看,79 家上市公司的入表金额在 500 万元以下,占比 61%。入表金额在千万元级别的有 22 家,500 万元至 1000 万元的有 18 家,100 万元至 500 万元的有 45 家,百万元以下的有 46 家。
  • 从科目看,以计入「无形资产—数据资源」为主。
  • 从企业性质看,实现数据资产入表的地方国企数量最多;央企有 17 家,入表总规模 24.30 亿元。

非上市公司的情况类似。据课题组基于公开信息的不完全统计,截至 2026 年 3 月 31 日,国内已有 417 家非上市公司披露了数据资源入表情况,整体增速放缓。其中制造业增长至 32 家,成为入表数量最多的行业。有存续期信用债的企业中,2025 年年报包含数据资产的共 134 家,较 2024 年增加 61 家,入表数据资产价值规模合计 15.42 亿元。

把这些数字放在一起,可以得到几个判断。

第一,入表的主体是数据的生产者,不是数据的加工者。 三大通信运营商、科大讯飞、航天宏图这类企业能够入表,是因为它们在提供主营业务的过程中天然沉淀了大量数据,成本可以从既有的会计科目里归集出来。而以数据加工为主业的公司,反而更难入表——它们的成本大量体现为人力和算力的持续投入,形态上更接近费用而不是资产。

第二,2025 年 12 月四部门那份通知,实质上给数据资产的账面价值封了顶。 「不得将以评估等方式得出的金额直接作为入账和调账的依据」这一条,意味着数据资产的账面价值只能反映历史成本,不能反映市场价值。一份加工成本 500 万元、市场上按调用次数一年能收 2000 万元的数据产品,在报表上仍然只值 500 万元。这个规定在防范虚增资产上是必要的,但它同时也解释了为什么入表规模上不去:账面数字与商业价值之间,本来就隔着一条制度性的沟。

第三,37.86 亿元这个数字,衡量的不是数据的价值,而是数据被组织化的程度。 一家企业能把数据资源入表,说明它至少完成了三件事:能说清这份数据是什么、能归集出加工它花了多少钱、能证明它未来能带来经济利益。这三件事本身就是第一公里的全部内容。136 家,占 A 股上市公司的 2.7% 左右。

52.26 ZB 与 37.86 亿元之间没有直接的可比性——一个是物理量,一个是会计量。但它们指向同一件事:数据的产生几乎不需要成本,数据的组织化却需要非常高的成本,而当前的市场机制还没有为后者建立起有效的回报路径。

三、场内百分之五

如果说入表数据反映的是数据资产化的进度,那么交易数据反映的是数据商品化的进度。后者的画面更加复杂。

截至 2026 年初,全国已建成各类数据交易机构超过 60 家。2025 年全行业场内交易规模刚刚突破 2000 亿元,其中北京、上海、广州、深圳、贵阳五大头部交易所占比超过 70%。剩下超过 50 家区域性平台,普遍处于「有场无市」的状态——部分省级交易所全年撮合交易不足 50 笔,年交易额不足亿元;超过 80% 的区域性交易所年交易额不足 10 亿元。

更值得注意的是场内与场外的比例。业内的通行估计是,场内交易仅占全国数据流通市场的 5% 左右,超过 95% 的数据交易仍以企业之间点对点的场外合作形式完成。

95% 这个比例,是理解中国数据要素市场的一把钥匙。

它说明数据交易本身是真实发生的,而且规模不小。企业之间买卖数据、交换数据、按接口调用付费,这些交易每天都在发生,只是没有走进交易所。原因也不复杂:传统交易所提供的主要是挂牌与撮合服务,而数据交易的核心痛点在于确权、合规、定价与安全交付。挂牌解决不了这四件事中的任何一件。

对一家采购数据的企业来说,进场交易增加的是流程成本,减少的是议价空间,而它真正需要的——「这份数据准不准」「买回来能不能用」「出了问题谁负责」——交易所回答不了。于是宁可承担一定的合规风险,也选择场外。

这种局面在 2026 年 2 月出现了转向。四部门《关于培育数据流通服务机构 加快推进数据要素市场化价值化的意见》是国内第一份针对数据流通服务机构的系统性制度文件,它做了三件事:

其一,明确了机构的分类。数据流通服务机构被分为数据交易所(中心)、数据流通服务平台企业、数据商三类,各自的功能边界被写清楚。这是「数据商」第一次在国家级文件中获得与交易所并列的位置。

其二,对交易所提出了数量控制。「统筹优化布局,严控数量,适时开展整合优化」,直接宣告粗放式扩张的终结。

其三,把交易所的定位从「交易中介」重构为「规则制定者、生态组织者、服务提供者」,要求强化合规保障、供需匹配等基础服务功能,增强价格发现、产品开发、生态培育等综合服务功能。

从研究的角度看,这份文件最重要的信号不是数量控制,而是它承认了数据流通的主战场不在交易大厅里。数据商——那些真正把原始数据加工成产品、直接面对最终用户的机构——被正式纳入了政策视野。

这个转向来得并不算早。市场早就用 95% 的比例投过票了。

四、定价:一份被写得很细的文件

在整条制度链里,有一份文件的技术含量远高于它获得的关注度,值得单独讨论——2025 年 1 月国家发展改革委与国家数据局联合印发的《关于建立公共数据资源授权运营价格形成机制的通知》,自 2025 年 3 月 1 日起施行。

它的技术含量在于,它是中国第一份把「一份数据产品应该卖多少钱」这个问题,用可操作的公式回答出来的官方文件。

先交代背景。公共数据是指各级党政机关、企事业单位在依法履职或提供公共服务过程中产生的数据,具有规模体量大、质量好、价值潜能大的特点。授权运营是指授权主体把这些数据授权给符合条件的运营机构,由后者进行数据治理、开发,向市场公平提供数据产品和服务。到目前为止,已有 25 个省(区、市)有序铺开授权运营工作,上海、安徽等地探索出「数据实验室」「运营机构+合伙人」等创新机制。2025 年,国家数据局组织开展的公共数据「跑起来」示范场景建设累计发布 100 个示范场景。

问题随之而来:运营机构把公共数据加工成产品之后,可以收多少钱?

这个问题很难。收得太低,运营机构没有动力投入加工,公共数据的价值释放不出来;收得太高,等于把本应「取之于公、用之于公」的公共资源变成了少数机构的垄断收益。

《通知》给出的答案分五个层次:

第一,划定定价范围。 用于公共治理、公益事业的,原则上不收费或只收取必要成本;用于产业发展、行业发展的,可收取公共数据运营服务费。也就是说,只有商业化利用的部分才进入定价范围。

第二,明确管理权限。 地方数据管理部门设立或指定登记机构登记的,按程序纳入地方定价目录,原则上由省级发展改革部门会同数据管理等部门制定收费标准,确有必要的可授权地级及以上人民政府制定。

第三,制定最高准许收入和上限收费标准。 这是整份文件的核心。准许收入由经营成本加准许利润构成,其中经营成本指运营机构在提供数据产品和服务过程中发生的、扣除政府补助后的合理费用支出,具体通过成本调查确定,主要包括:

  • 授权运营相关平台建设和运维成本;
  • 数据传输、汇聚、存储、治理等成本;
  • 人力资源成本;
  • 获取公共数据资源的相关支出;
  • 期间费用。

准许利润率按照成本调查前一年 10 年期国债平均收益率加不超过 6 个百分点确定,具体由有定价权限的发展改革部门会同数据管理部门明确。

第四,明确收费形式。 具体可按产品数量、服务次数、服务时间、数据调用量等形式收费。

第五,建立定期评估调整制度。 在评估周期内,授权主体每年根据运营机构实际收入、销售规模等情况,指导其合理调整收费标准;运营机构需报告整体经营状况、开展授权运营的成本开支、实际收入及利润、具体产品和服务的销售规模及收入、实际收入与最高准许收入的偏离情况等。

把这五条读完,会发现它借用的是一套非常成熟的监管框架——公用事业的准许成本加合理收益定价法。电网、供水、天然气管输的价格都是这么定的:先做成本监审,再核定准许收入,再折算到具体的收费标准,然后定期回头评估。

用管电网的办法管数据,这个类比本身值得琢磨。它意味着监管者对公共数据的定位是准公用事业:具有自然垄断属性、需要大额前期投入、服务对象广泛、不宜完全市场化定价。

从第一公里的角度看,这份文件有三个直接价值。

其一,它第一次官方确认了「加工是有成本的」。 经营成本清单里的五项,前四项全部是加工环节的开销——平台建设、传输汇聚存储治理、人力、数据获取。这份清单等于承认,数据从原始状态到可售状态之间,隔着一笔实实在在的投入。这一点在会计口径上尤其重要:2025 年 12 月四部门通知要求数据资源以成本计量,而成本包括哪些,这份价格文件给出了参照答案。

其二,「按数据调用量收费」被写进了官方定价形式。 这是一个容易被忽略的细节。在传统的数据交易想象里,交易的单位是「一份数据集」——买方付一笔钱,拿走一批数据。而按调用量收费意味着交易的单位变成了「一次查询」,买方不占有数据,只购买使用。这两种形态的差别,在本文第 21 章和第 22 章会详细讨论,它是数据产品从「卖拷贝」走向「卖服务」的分水岭。

其三,它给市场化数据产品提供了一把定价标尺。 公共数据授权运营的价格是被管制的,社会数据加工的价格不受管制。但当公共数据产品的价格按准许成本加合理收益核定出来之后,市场化数据产品的定价就有了参照系——如果一份市场化数据产品的价格远高于同类公共数据产品,买方会追问溢价从何而来;如果远低于,卖方需要解释自己的成本是怎么覆盖的。

当然,这份文件的适用范围仅限于公共数据资源授权运营。本文讨论的工厂数据,主要来源是社会数据与公开信息,不在其管辖之内。但方法论是相通的:任何一份数据产品的定价,最终都要回答「加工它花了多少钱」和「它被使用了多少次」这两个问题。

五、另一条路径:12.6 万个高质量数据集

在交易所的场内交易长期低迷的同时,数据要素领域出现了一条完全不同的路径,而且跑得比交易快得多。

这条路径叫高质量数据集。

所谓高质量数据集,是指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、能有效提升模型性能的数据的集合,包含行业通识和行业专识数据集。

它的增长速度是这样的:

  • 截至 2026 年 3 月底,全国已建成的高质量数据集总体量在 900 PB 量级;
  • 截至 2026 年 6 月底,已建成高质量数据集超过 12 万个,总体量超过 1565 PB,较一季度末增长超过 60%;
  • 截至 2026 年 8 月,全国累计建成高质量数据集超过 12.6 万个,数据总体量超过 1815 PB,较 2026 年 3 月增长超过 89%。

半年时间,体量增长将近一倍。作为对照,同期数据交易所的场内交易规模增长要慢得多。

为什么这条路径跑得更快?

第一,需求方非常明确。 高质量数据集的买家是模型训练方——大模型企业、自动驾驶厂商、行业智能体开发者。它们的需求是刚性的、连续的,而且愿意为质量付溢价。相比之下,传统数据交易的买家画像一直是模糊的。

第二,价值评判标准相对客观。 一份数据集好不好,可以用模型效果来验证。国家数据局指导全国数标委研制了《高质量数据集建设指南》《高质量数据集格式要求》《高质量数据集分类指南》等 5 项国家标准,初步构建起「数据质量检测+基准模型验证」相结合的质量检测方法和工具,已对 12 个数据集、超过 4563 万条数据完成检测。「用基准模型跑一遍看效果」这种验证方式,比数据交易里的质量承诺要硬得多。

第三,产业配套跟得上。 数据标注产业在同期快速成长:2024 年我国数据标注产业规模突破 80 亿元,年均增速超过 20%;国家层面布局了「7+32」数据标注先行先试格局,7 个国家级数据标注基地已建成高质量数据集 524 个,服务 163 个大模型,带动相关产值超过 83 亿元。区域集聚也在加速——截至 2026 年 7 月底,仅贵州一省数据标注企业就达 135 家,从业人员突破 1.6 万人;沈阳市汇聚数据标注从业人员超过 1.32 万人。

政策也在向这个方向加码。国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》,聚焦国民经济发展重点行业和战略性新兴产业,部署强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六个专项行动,明确到 2028 年底建成一批覆盖重点领域、经过应用验证的行业高质量数据集。

从第一公里的角度看,高质量数据集路径提供了一个重要启示:当数据的用途足够具体时,加工环节的价值就能被识别和支付。

模型训练是一个用途极其具体的场景。一份数据集能不能提升模型效果,几周之内就能验证。用途具体,验证闭环短,付费意愿就强,加工投入就有回报,产业就能自我循环。

反过来说,数据交易长期低迷的一个深层原因,可能正是「用途不够具体」。挂牌一份「某省工商企业基础信息数据集」,买方看不出它能解决自己的什么问题,也无法在短期内验证效果,自然不愿付费。

这个启示对工厂数据同样适用。「480 万家工厂的基础档案」作为一个数据集听起来很大,但它对任何一个具体买家的价值都是模糊的。而「帮我找出长三角所有能做医疗级注塑、有 ISO 13485 认证、员工规模 100 到 500 人的工厂,并给出可联系的决策人」——这是一个用途具体、结果可验证、付费意愿明确的请求。

数据产品的价值不在数据本身,而在它被组织成什么形状。这句话贯穿本文后半部分。

六、两块拼图:可信数据空间与三权分置

制度屋顶还有两块拼图需要交代,它们共同回答了「数据在流通时,信任从哪里来」。

第一块是可信数据空间。

2024 年 11 月,国家数据局印发《可信数据空间发展行动计划(2024—2028 年)》,提出到 2028 年建成 100 个以上可信数据空间,形成一批数据空间解决方案和最佳实践。行动计划把可信数据空间定义为「基于共识规则,联接多方主体,实现数据资源共享共用的一种数据流通利用基础设施」,并分类推进企业、行业、城市、个人、跨境五类空间的建设。

可信数据空间要解决的核心问题是:多方共享数据时,如何在不把数据交出去的前提下让别人用。技术上依托区块链与隐私计算,制度上依托接入认证体系、空间合约和履约行为存证体系。行动计划还特别提出,引导运营者提供数据标识、语义转换等技术服务,推动参与各方通过数据资源封装、数据资源目录维护等手段,实现数据产品和服务的统一发布、高效查询、跨主体互认。

「数据标识」和「语义转换」这两个词,在一份基础设施文件里出现,值得留意。它承认了一个现实:即便技术上打通了通道,不同主体的数据在语义上仍然对不上——甲的「产能」是设计产能,乙的「产能」是实际产量;甲的「员工人数」来自社保,乙的「员工人数」来自自报。通道通了,语义不通,共享仍然无法发生。

第二块是三权分置的落地。

「数据二十条」提出三权分置之后,问题变成了如何让这三种权利可登记、可举证、可流转。目前的做法是建立数据产权登记制度:数据产权分为持有权、使用权、经营权三类独立可分割的财产权利,支持单独登记、分属不同主体;同一权利人可以全部享有,也可以只享有其中一项或多项。

登记的意义在于赋予公信力。有了登记凭证,数据资产才可能被抵押、被融资、被作价入股。实践中已经出现了对应的金融产品:2026 年 5 月,中国银行温州市分行发布「数据产权贷」,依托数据产权登记证书、数据知识产权、数据资产登记凭证、数据合规评审证书四证增信体系,授信总额 5 亿元。截至目前,已入表企业累计获得包括银行授信、作价入股等形式的融资 20.92 亿元。

需要注意的是,数据资产登记并不是入表的必需程序。但多数企业会在入表前先做登记,因为登记可以佐证数据产品的权属清晰与价值稳定,个别地方性文件还明确规定登记可以作为入表依据。

把两块拼图放回整体:可信数据空间解决的是「流通时如何互信」,三权分置与登记解决的是「流通前如何确权」。加上前面讨论的定价机制、会计计量、机构分类,制度屋顶的六根柱子就齐了。

现在可以回到本文的起点。屋顶已经封顶,柱子已经立起,但屋子里空空荡荡——因为真正能被交易、被登记、被写进报表的数据产品,数量远远不够。

不够的原因不在屋顶,在地基。接下来的第二部分,把镜头对准地基:一家工厂的数据,到底难在哪里。

第二部分 第一公里的地形

制度层面的讨论到此为止。从这一部分开始,本文把镜头压到最低,对准一家具体的工厂。

一家工厂在数据世界里的完整画像,可以拆成八个基本字段:名字、身份、分类、性质、产能、人、位置、时间。这八格看起来都很简单,简单到任何一个人都会觉得「这有什么难的」。

但恰恰是这八格,构成了中国产业数据最顽固的一段瓶颈。下面逐格拆开。

七、名字:一家工厂到底叫什么

从名字开始,是因为名字是所有数据关联的锚点。两条数据能不能拼到一起,第一步永远是判断它们说的是不是同一家企业。

中国的企业名称登记有一套明确的规则:企业名称一般由行政区划、字号、行业或经营特点、组织形式四部分依次组成。比如「宁波市镇海区弘盛精密机械制造有限公司」,行政区划是宁波市镇海区,字号是弘盛,行业是精密机械制造,组织形式是有限公司。

规则很清楚。问题出在规则之外。

第一,同一家工厂在不同场合使用不同的名字。

营业执照上是「宁波市镇海区弘盛精密机械制造有限公司」,招投标公告里可能写成「宁波弘盛精密机械」,招聘网站上可能挂着「弘盛机械」,行业展会的展位牌上可能是「HONSON」,海关报关单上是英文全称,产品铭牌上可能只有一个商标。这五个名字指向同一个主体,但字面上没有一个能直接匹配另一个。

第二,字号重名极为普遍。

企业名称的排他性只在同一登记机关辖区、同一行业内成立。这意味着「弘盛」这个字号,在全国范围内可以有成百上千家企业同时使用,而且其中不少都在机械行业。当一条数据只提供了「弘盛机械」这个简称时,仅凭名称无法定位到唯一主体。

第三,名称会变。

企业更名是常规操作,原因可能是业务转型、股权变更、品牌升级,也可能是为了规避此前的负面记录。工商登记会保留「曾用名」,但很多第三方数据源不会——它们只记录抓取那一刻的名称。于是同一家企业在不同时点被抓取的数据,会以两个完全不同的名字存在,除非有人主动把它们合并。

第四,主体与工厂不是一对一的。

一家公司可能有三个厂区分布在两个省;一个厂区里可能同时挂着三家关联公司的牌子——一家持有土地厂房,一家负责生产,一家负责销售开票。采购方问「这家厂能不能做」,问的是生产实体;财务方问「跟谁签合同」,问的是签约主体;风控方问「谁承担责任」,问的是法律主体。三个问题指向同一个物理厂区,答案却是三个不同的名字。

这四层复杂性叠加起来,导致一件在外行看来匪夷所思的事情:在产业数据的实际加工中,「判断两条记录是不是同一家企业」这件事,本身就是一个需要专门算法、并且无法做到 100% 准确的技术问题。

这个问题在学术上叫实体解析(entity resolution)或记录链接(record linkage),在工程上通常被称为主体对齐。本文第 16 章会展开讨论它的方法。这里只需要记住一个结论:名字不是标识符,名字只是线索。

八、身份:统一社会信用代码解决了什么

既然名字不可靠,那么用代码可不可以?

中国在这件事上做过一次相当成功的基础设施改革。2015 年起推行的「三证合一、一照一码」,把工商营业执照、组织机构代码证、税务登记证合并为一张加载 18 位统一社会信用代码的营业执照。到 2018 年,存量主体的代码转换基本完成。此后,每一个在中国境内登记的法人和其他组织,都有且只有一个 18 位代码,终身不变。

这是一次教科书级别的标识符治理。它带来的价值怎么评价都不过分:跨部门数据共享有了共同的主键,工商、税务、社保、海关、司法的数据第一次可以在主体层面对齐。

但统一社会信用代码解决的是「谁是谁」,没有解决另外两个问题。

第一,它不回答「这个主体现在是什么状态」。

登记状态有存续、在业、迁入、迁出、停业、清算、注销、吊销等多种,但这些状态描述的是法律状态,不是经营状态。一家企业可以在工商登记上「存续」十年,实际上厂房早已出租、设备早已变卖、只保留一个空壳等待处置。反过来,一家因为地址异常被列入经营异常名录的企业,可能只是换了办公地点忘了变更登记,生产完全正常。

法律状态与经营状态之间的偏差,在制造业尤其明显。制造业的退出往往是渐进的:先减产,再停线,再遣散,最后才注销。中间这段时间可能长达数年,而在工商数据里,它自始至终是「存续」。

第二,它不回答「这个主体的边界在哪里」。

一址多照、集群注册是合法的登记形态。一个地址上可以注册几十家甚至上百家企业,尤其在商务秘书公司集中的园区。反过来,一家真实运营的工厂,其厂区地址可能与注册地址完全不同——注册在市区的写字楼,生产在郊区的工业园。

对于需要「找到真实生产地点」的场景,注册地址的参考价值有限。

第三,代码本身不携带产业信息。

18 位代码的结构是:登记管理部门代码 1 位、机构类别代码 1 位、登记管理机关行政区划码 6 位、主体标识码(组织机构代码)9 位、校验码 1 位。它告诉你这个主体在哪里登记、由谁登记,但不告诉你它在做什么、做得多大。

这就引出了下一格:分类。

九、分类:1382 个小类装不下几百万家工厂

现行的《国民经济行业分类》(GB/T 4754—2017)由国家质检总局和国家标准委于 2017 年 6 月 30 日联合发布,同年 10 月 1 日实施,2019 年发布过第 1 号修改单。分类共分门类、大类、中类、小类四个层次,包含门类 20 个、大类 97 个、中类 473 个、小类 1382 个。

其中制造业是 C 门类,下辖 31 个大类,从 C13 农副食品加工业一直到 C43 金属制品、机械和设备修理业。

这套分类是国民经济统计的基石,设计目标是保证统计口径的稳定性与国际可比性。作为统计工具,它是合格的。但把它当成产业数据的检索维度使用,粒度就明显不够了。

举一个具体的例子。C33 是金属制品业,下辖 7 个中类;其中 C335 是金属工具制造,再下辖 6 个小类,包括切削工具制造、手工具制造、农用及园林用金属工具制造、刀剪及类似日用金属工具制造、金属制厨房调理及卫生器具制造、其他金属工具制造。

到这里已经是分类体系的最细一级了。而现实是,「切削工具制造」这一个小类下面,市场上流通的产品至少包括:硬质合金刀片、高速钢铣刀、PCD 刀具、CBN 砂轮、丝锥板牙、拉刀、滚刀、可转位刀具、成型刀具、超硬涂层刀具……每一种的工艺路线、设备构成、客户群体、技术门槛都不一样。一家做硬质合金刀片的企业和一家做丝锥板牙的企业,除了行业代码相同,几乎没有任何共同点。

对于采购方来说,「我要找 C3351 切削工具制造的企业」这个检索条件毫无意义——它会返回数万家结果,而其中真正能做你要的那种刀具的,可能只有几十家。

行业分类之外,还有一套描述企业业务的官方数据:经营范围。

市场监管总局制定了《经营范围规范表述目录》,各类经营主体按目录自主选择规范条目办理登记,登记机关调用总局统一接口提供查询和选择服务,对新业态、新行业允许参照政策文件、行业习惯或专业文献提出申请,由省局报请总局更新调整。

规范表述解决了「各地登记标准不一致」的问题,让经营范围从自由撰写变成了标准选项。但它同时带来一个副作用:规范化提高了整齐度,没有提高真实度。

企业在登记经营范围时,普遍的做法是尽量选全——把当前做的、以后可能做的、听起来相关的条目都勾上,避免日后超范围经营。于是一家实际只做注塑件的工厂,经营范围里可能同时包含塑料制品制造、模具制造、五金产品批发、货物进出口、技术服务等十几项。

从数据加工的角度看,经营范围是一个高召回、低精度的字段:它几乎不会漏掉企业真正在做的业务,但也包含了大量它并不在做的业务。

分类粒度不足与经营范围虚化,这两个问题合起来,构成了产业数据检索的第一道墙。

如何翻过这道墙?目前市场上的实践路径是重建一套面向应用的产品分类体系——不以统计口径为基准,而以「买方会怎么问」为基准。天下工厂产业平台在其工厂库上构建的细分行业类目为 1965 个,大约是国民经济行业分类小类数量的 1.4 倍,但两者的分布重心完全不同:国民经济分类要覆盖 20 个门类的全部经济活动,而 1965 个类目全部集中在制造相关领域,粒度自然更细。

这类重建有一个绕不开的代价:它不是国家标准,无法在跨机构统计中直接复用。行业实践中通常的做法是保留双轨——对内按应用分类组织检索,对外与国民经济行业分类保持可映射,两套体系各司其职。

十、判定:经营范围为什么不能用来判断是不是工厂

这一章是全文技术上最核心的一章。

回到序章那个问题:中国有多少家工厂?无论采用哪种口径,前提都是先能判断「一家给定的企业是不是工厂」。

直觉上这个判断很简单:看它登记的行业门类是不是 C 制造业,或者看它的经营范围里有没有「制造」「生产」「加工」这些词。

这个直觉是错的,而且错得相当彻底。原因在于,登记信息描述的是企业申报的经营意图,不是它的实际生产能力。

有两类错误。

第一类是伪阳性:登记为制造业,实际不生产。

一家注册资本 100 万元、员工三人、办公地址在写字楼、经营范围写着「机械设备制造」的公司,在工商数据里是一家制造业企业。它的实际业务可能是从真正的工厂进货、贴自己的牌子转售,也可能只是一个为了投标资质而设立的壳。

这类主体的数量并不小。原因是设立一家制造业企业的登记门槛与设立一家贸易公司完全相同——不需要提供厂房证明,不需要提供设备清单,不需要环评批复(环评是开工前的另一套程序,与登记无关)。经营范围里写「制造」是零成本的。

第二类是伪阴性:不登记为制造业,实际在生产。

三种典型情况:

  • 个体工商户形态的加工厂。在很多产业带,成规模的加工作坊登记为个体工商户,行业分类不进入 C 门类,但有厂房、有设备、有稳定订单。
  • 登记在批发零售业的工贸一体企业。一家企业的主营是外贸出口,登记行业写的是「贸易」,但它自有工厂,只是没有把制造放在主营行业上。
  • 归在其他门类的生产活动。比如废弃资源综合利用(C42)与金属制品、机械和设备修理业(C43)虽在制造业门类内,但再制造、翻新、拆解这类活动的边界一直模糊;而部分实际从事生产的主体,登记在科技推广、技术服务等门类下。

两类错误叠加,结果是:以登记行业为准的「制造业企业名单」,既包含了大量不生产的企业,又遗漏了大量在生产的主体。 对统计而言这不算致命,因为统计要的是总量趋势;对商业应用而言这是致命的,因为商业应用要的是可直接联系的具体名单。

那么,如何判断一家企业是否真的在生产?

可行的方法是放弃单一字段的判断,转向多源硬信号的交叉验证。所谓硬信号,指的是那些造假成本高、与生产活动强相关、且能在公开渠道观测到的信息。常见的几类:

  • 招工记录。 一家在持续招聘注塑机操作工、CNC 编程员、装配工、质检员、仓管的企业,几乎不可能没有生产现场。招聘岗位的工种构成,还能反推工艺类型;招聘的规模与频率,能反推产能变化。
  • 设备与厂房痕迹。 招标采购公告、设备融资租赁记录、厂房租赁或购置信息、用电用能相关公示,都能佐证生产资产的存在。
  • 招投标与供应记录。 作为供应商中标的记录,尤其是需要提供生产资质的标的,是较强的生产能力证据。
  • 进出口活动。 有出口实绩意味着有可交付的产品。需要注意的是,出口可以通过外贸代理完成,报关主体不一定是生产主体,这里存在一层需要拆解的关系。
  • 专利与技术资质。 实用新型和发明专利的技术领域,能反映真实的工艺方向;高新技术企业、专精特新等资质的认定过程包含实地核查,可信度较高。
  • 行业展会与团体成员身份。 参加专业展会需要付费和实物展品,行业协会会员身份通常有资格审核,这两类信息的伪造收益低。

单独看,每一类信号都有噪声。招聘信息可能是中介代发;招投标可能是联合体挂名;专利可能是为了资质突击申请的。但多类独立来源的信号同时指向同一个结论时,结论的可靠性会显著提升——这是交叉验证的基本逻辑,也是本文第 17 章的主题。

最后要说清楚一个工程上的取舍。

工厂判定本质上是一个二分类问题,任何二分类都要在精度(判为工厂的里面有多少真是工厂)和召回(真工厂里有多少被判出来)之间取舍。

取舍的方向取决于用途。如果用途是宏观统计,应当偏向召回,宁可多算不可漏算;如果用途是给销售人员一份可以直接打电话的名单,应当偏向精度——名单里混进 20% 的贸易公司,销售员打三通电话就会对整个名单失去信任。

这个取舍看起来是技术选择,实际上是产品定位选择。它决定了一套工厂数据到底服务谁。

十一、规模:注册资本与社保人数的信号价值

判断一家工厂「有多大」,公开数据里可用的字段并不多,最常被使用的两个是注册资本和社保参保人数。这两个字段的信号质量差别极大,值得分别讨论。

注册资本的信号价值,在过去十年里被两次改革反复改写。

2014 年,公司法修订,注册资本从实缴制改为认缴制,取消了最低注册资本限制,也取消了验资要求。改革的初衷是降低创业门槛,效果也确实达到了——但副作用是注册资本这个字段迅速失真。此后几年,注册资本一亿元、实缴零元的公司大量出现,注册资本从「企业实力的证明」退化成「股东承诺的数字」。

2023 年 12 月修订、2024 年 7 月 1 日起施行的新公司法,对认缴制打了一个补丁:有限责任公司全体股东认缴的出资额应当自公司成立之日起五年内缴足。这条规定给认缴制装上了时限,注册资本重新与实际出资挂钩,也引发了存量公司的一轮减资潮。

对数据加工者而言,这两次改革意味着注册资本这个字段有三段不同的语义:2014 年前登记的是实缴,2014 年至 2024 年间登记的是纯承诺,2024 年之后登记的是有时限的承诺。用同一个阈值去筛选不同年份成立的企业,比较的其实不是同一件事。

即便如此,注册资本仍然是有用的——它的用处不在于精确刻画实力,而在于提供一个粗粒度的分层。以天下工厂产业平台的工厂库为样本口径统计,注册资本在 100 万元及以上的工厂约占 49.87%,也就是说这个字段大致能把工厂库对半分开。对于需要快速缩小范围的场景,一个能对半分的字段是有价值的;对于需要判断偿付能力的场景,它远远不够。

社保参保人数的信号质量要好得多,但它有自己的盲区。

社保参保人数来自企业年报公示,是公开信息中最接近真实用工规模的字段。它的优势在于造假动机弱——多报要多缴费,少报有合规风险。

盲区有三个:

  • 缺失。 部分企业不公示或公示为零,尤其是小微企业。字段为空不等于没有员工。
  • 口径不匹配。 参保人数统计的是与企业签订劳动合同并由企业缴纳社保的人。使用劳务派遣、生产外包、季节性用工的制造企业,实际在厂区里工作的人数可能是参保人数的两三倍。这在服装、食品、电子组装等劳动密集型行业尤其明显。
  • 滞后。 年报公示的是上一年度的数据,反映不了当年的产能变化。

尽管有这些盲区,社保人数依然是判断工厂规模最可靠的单一公开字段。实践中的用法通常是把它作为分档依据而非精确数值:一百人以下、一百到五百人、五百到一千人、一千人以上,这样的分档足以支撑绝大多数商业判断,而且对字段本身的误差有较强的容忍度。

这里可以总结出一条通用原则:当一个字段的绝对精度不可靠时,把它降维成分档使用,往往能保留大部分信息价值,同时避免把噪声当信号。 这条原则在后面讨论产能、位置、时间时会反复出现。

十二、产能:一家工厂到底在造什么

「在造什么」是采购方最关心的问题,也是公开数据里最难回答的问题。

难点在于,产品信息没有一个权威的登记来源。工商登记里有经营范围,但如前所述,经营范围是意图不是事实。真正能反映产品的信息,散落在六类来源里,每一类都有各自的偏差。

其一,企业官网。 优点是产品描述最详细,通常有型号、参数、应用场景、产品图。缺点是覆盖率低,而且更新极不及时——大量中小工厂的官网停留在五年前甚至十年前的状态,还有相当比例的官网已经打不开。以天下工厂平台的抓取结果为参照,能找到并成功解析官网的工厂占比在 10% 上下量级。也就是说,指望靠官网理解产品,一开始就放弃了九成的样本。

其二,B2B 平台的商品页。 优点是结构化程度高,有类目、价格、起订量。缺点是店铺主体与生产主体不一致的比例很高——平台上大量标注为「工厂」的店铺,实际是贸易商或者档口。用店铺信息推断生产能力,会引入系统性偏差。

其三,招投标记录。 优点是可信度高,中标标的通常有明确的技术规格。缺点是覆盖偏向,只有参与政府采购和大型企业采购的工厂才会出现,大量做民品出口的工厂完全不在其中。

其四,专利文本。 优点是技术方向清晰,而且专利的分类号(IPC)本身就是一套精细的技术分类体系,比国民经济行业分类细得多。缺点是专利反映的是研发方向而不一定是量产产品,还存在为了申报资质而突击申请的情况。

其五,进出口报关信息。 优点是产品名称具体、有 HS 编码、能反映实际交易。缺点是可获得性受限,且如前所述,报关主体与生产主体经常分离。

其六,招聘信息。 这一类容易被忽略,但信息密度出人意料地高。一则招聘「五轴加工中心操作工,熟悉钛合金加工,有航空零件加工经验优先」的信息,同时透露了设备类型、材料能力、下游行业三个维度。招聘信息的更新频率也远高于官网——工厂可以十年不更新网站,但招人是持续行为。

把六类来源合起来看,产品信息加工的真实工作量在于两件事:

第一件是抽取。 从非结构化文本里把产品词识别出来。这件事在大模型出现之前依赖规则和词典,覆盖面受限于词典的完备程度;大模型出现之后,抽取的召回率有了实质性提升,但也引入了新的风险,本文第 19 章会专门讨论。

第二件是归一。 同一种产品有几十种叫法。「注塑模具」「塑胶模具」「塑料模具」「injection mold」指的是同一件东西;「五金件」「金属零件」「精密结构件」在不同语境下可能重叠也可能不同;还有大量行业黑话和地方叫法。归一化需要一套持续维护的同义词与上下位关系词典,而这套词典没有任何官方版本可以直接拿来用,只能在实践中一点点积累。

产能规模比产品品类更难。公开数据里几乎没有直接的产能字段,只能靠代理变量推断:厂房面积、设备数量、用工规模、用电量、产值区间。这些变量的可得性都不理想,推断结果只能给出量级而非精确值。

因此在实践中,成熟的做法是不承诺精确产能,而是提供可核验的能力标签——比如「具备五轴加工能力」「有医疗器械生产许可」「通过 IATF 16949 认证」。标签的价值在于它是二元的、可验证的,比一个模糊的产能数字有用得多。

十三、人:最难的一格

八个字段里,最有商业价值、也最难做的,是「谁能拍板」。

对于向工厂销售设备、原材料、软件、服务的一方来说,找到工厂只完成了一半工作,找到能做决定的人才是关键。一份没有联系人的工厂名单,商业价值会打掉七成以上。

这一格难在三个层面。

第一层是可得性。

企业的公开电话通常是总机或前台,而采购决定通常由采购经理、生产厂长、技术负责人或老板本人做出。总机号码的转化效率极低——绝大多数销售电话在前台环节就被拦截。

真正有效的是决策人的直线联系方式,而这类信息不存在于任何单一的官方登记中。它散落在招聘信息的联系人、招投标文件的项目负责人、展会名录、行业协会会员通讯录、企业官网的联系页、公开的商务合作信息里,需要从多个来源汇聚并交叉验证。

第二层是准确性。

联系方式是所有字段里失效最快的。人员流动、号码更换、部门调整,都会让一条昨天还有效的记录今天失效。而且失效是静默的——数据本身不会告诉你它已经过期,只有实际拨打之后才知道。

这决定了联系方式类数据必须建立持续的核验回路,而不能一次采集长期使用。核验的成本很高,因为它无法完全自动化。

第三层,也是最关键的一层,是合规性。

工作场景中的联系方式,其法律性质是复杂的。《个人信息保护法》保护的是「以电子或者其他方式记录的与已识别或者可识别的自然人有关的各种信息」。一个能定位到具体自然人的手机号码,属于个人信息,无论它是在工作场景还是生活场景中使用。

同时,法律也规定了处理个人信息的合法性基础,其中包括「在合理的范围内处理个人自行公开或者其他已经合法公开的个人信息」。企业负责人在招投标文件中公开的项目联系方式、在行业展会名录中公开的商务联系方式,属于「已经合法公开」的范畴,但「合理的范围」如何界定,仍然需要个案判断。

在实践层面,负责任的做法通常包含几条底线:

  • 只处理在商务场景下已经公开的联系方式,不涉及私人生活场景的信息;
  • 存储时脱敏,展示时按权限解锁,而不是批量导出可自由传播的明文清单;
  • 保留每一次调取的审计记录,做到可追溯;
  • 提供有效的异议与删除渠道,个人提出后能够实际执行。

这几条底线不是可选项。它们既是法律要求,也是这类数据能够长期存在的前提——一旦联系方式被当作可以随意批量倒卖的商品,整个数据品类会在监管层面失去合法性。

从市场现状看,这一格的供给缺口相当明显。以天下工厂产业平台的对外口径,其工厂库中带有决策人直连联系方式的工厂超过 300 万家。这个数字之所以值得单独说明,是因为它衡量的不是采集能力,而是采集、核验、脱敏、授权、审计这一整套机制的运行结果。只做采集不做后面四件事,规模可以更大,但走不远。

十四、位置:注册地址与真实厂址之间

位置这一格看起来最简单——工商登记里有地址字段,直接拿来用就行。

实际上,注册地址与生产地址的分离在制造业中相当普遍。原因包括:注册在市区便于办理业务和招聘,生产在郊区工业园区受土地政策约束;集团化企业把注册主体放在总部所在地,生产基地分布在多个省份;早期在孵化器或商务秘书公司注册,投产后未及时变更。

对于不同的使用场景,需要的是不同的地址:

  • 判断行政归属、税收关系、政策适用,需要注册地址;
  • 计算物流距离、运输成本、配套半径,需要生产地址;
  • 上门拜访、验厂、审核,需要生产地址中最主要的那一个。

把地址变成可计算的位置,还要经过地理编码这一步,也就是把文本地址转换成经纬度坐标。这一步的误差来源很多:地址书写不规范、道路和门牌变更、同名地名、行政区划调整。一个必须坚持的校验原则是,地理编码的结果必须与来源数据中的省市区信息一致——如果一条地址文本写的是「浙江省台州市」,而编码结果落在了江苏,那么这条结果应当被判为失败而不是被采纳。看似简单的一致性校验,能拦掉相当比例的静默错误。

有了坐标之后,能做的分析会显著扩展。天下工厂产业研究院此前发布的《选址的科学:当 345 万个工厂坐标遇上 AI》一文,即以工厂坐标数据为基础,讨论了产业集群的算法识别与配套半径的测量,可作为这一维度的延伸阅读。

位置这一格还有一个衍生维度:产业带。

中国制造业的空间分布高度集聚,一个镇甚至一个村可能集中了某个细分品类的大部分产能。这种集聚不体现在任何官方分类里——行政区划只到区县和乡镇,产业属性不进入区划体系。要把「浙江省诸暨市大唐街道—袜业」这样的产业带识别出来,需要把地理坐标与产品类目做联合聚类。天下工厂平台在其工厂库上标注的产业带数量为 1000 个以上。

对于寻源方来说,产业带是一个效率极高的检索维度:与其在全国范围内搜索某个品类,不如先定位到两三个核心产业带,再在其中筛选。

十五、时间:数据的保质期

最后一格是时间,也是最容易被忽略的一格。

产业数据的每个字段都有不同的半衰期:

  • 统一社会信用代码:终身不变;
  • 成立日期、注册地行政区划:基本不变;
  • 法定代表人、注册资本、经营范围:年级别变化;
  • 登记状态、社保人数、资质证书:年级别更新,但状态跃迁可能突然发生;
  • 产品线、设备配置:年级别变化,无公开更新源;
  • 联系人与联系方式:月级别失效;
  • 招聘、招投标、报关等行为数据:天级别产生。

一套数据的整体新鲜度,取决于其中最快失效的那个字段。这带来一个残酷的经济学结论:数据的维护成本不由字段总数决定,而由更新最频繁的那几个字段决定。

这也解释了为什么产业数据领域的竞争,最终会落在运营能力而不是采集能力上。第一次把 400 万家企业的信息采集完整,是一个可以在一年内完成的工程项目;此后每年让这 400 万条记录保持有效,是一个永远不会结束的运营任务,而且成本逐年递增——因为存量越大,需要维护的记录越多。

在数据结构上,有一个容易犯的错误值得点出:把可变字段直接覆盖更新,不保留历史。

覆盖更新的系统只能回答「现在是什么」,无法回答「什么时候变的」。而在产业分析中,变化本身往往比状态更有信息量——一家工厂的社保人数从 300 人降到 80 人,这个变化的价值远大于「当前 80 人」这个事实。等到需要分析趋势时才想起来建历史表,已经错过了所有历史。

正确的做法是对关键可变字段建立快照或时序记录,从第一天开始积累。这件事的成本在早期极低,在后期无法弥补。


八格拆完,可以做一个小结。

工厂数据的难点不在于任何单独一格,而在于八格必须同时成立才有商业价值。一条只有名字和地址的记录,价值接近于零;一条有名字、有分类、有产品、有规模、有联系人、且每一项都在有效期内的记录,才是可以直接使用的线索。

八格的成立概率是相乘的关系。假设每一格的可靠率是 90%,八格全对的概率是 43%。这个乘法,就是产业数据加工的真正难度所在,也是本文第三部分要讨论的方法论所面对的问题。

第三部分 加工的方法论

第二部分描述了地形,这一部分讨论怎么走。

需要先说明本文的边界。数据加工的具体工程实现——用什么存储引擎、如何设计索引、怎样调度任务——不在本文讨论范围内,那属于系统实现的细节,且各家做法不同。本文关心的是方法论层面的选择:从哪里取数、如何判断真伪、如何度量质量、如何表述口径。这些选择不依赖具体技术栈,而且做错了,再好的工程实现也救不回来。

十六、汇聚:六类来源与它们各自的偏差

产业数据加工的第一步是汇聚。汇聚的核心不是「尽可能多地拿到数据」,而是清楚每一类来源在系统性地偏向什么。

一个来源的偏差如果被识别出来,可以在后续处理中校正;如果没有被识别,它会以「看起来很合理的结论」的形式渗透到最终产品里。这是产业数据研究中最常见的错误来源。

下面逐类说明。

第一类:工商登记类信息。

这是最基础的一层,覆盖率接近全体经营主体,权威性最高。包含名称、统一社会信用代码、成立日期、注册资本、法定代表人、股东、登记状态、注册地址、经营范围、行业分类、年报公示信息(含社保参保人数)等。

它的系统性偏差是申报偏差:所有内容都是企业自己申报、登记机关形式审查的结果。登记机关核验的是材料齐全与格式合规,不核验业务真实性。前面讨论过的经营范围虚化、注册资本失真、注册地址与生产地址分离,都是这一偏差的具体表现。

正确的用法是把工商信息当作主体骨架——用它确定「有哪些主体、主体的法律身份是什么」,而不是用它判断「主体在做什么、做得怎么样」。

第二类:招聘信息。

覆盖率取决于企业是否在线招聘,制造业中大中型企业覆盖较好,微型企业覆盖较差。信息新鲜度高,是所有来源里更新最快的之一。

系统性偏差是规模偏差与周期偏差。规模偏差指招聘频率与企业规模正相关,一家 20 人的稳定工厂可能几年不发布招聘信息,会被误判为不活跃。周期偏差指招聘量随订单周期波动,淡季数据会低估产能。

另外还有一个技术性问题:相当比例的招聘信息由人力资源中介代发,落款企业与用工企业不一致,需要识别并剔除。

第三类:招投标与采购公告。

权威性高,信息具体,包含标的物、金额、技术要求、中标方。

系统性偏差是领域偏差,而且这个偏差非常强。招投标数据集中在政府采购、国有企业采购、大型工程项目,覆盖的是「向体制内和大企业供货」的那部分企业。做外贸出口的、做民营下游的、做消费品的工厂,可能一辈子不出现在任何招投标记录里。

用招投标数据评估一个行业,会系统性地高估国企供应链的重要性,低估民营外向型经济的规模。

第四类:进出口与海关相关信息。

能反映真实的跨境交易,产品名称和 HS 编码具体。

系统性偏差是主体错位。中国有相当比例的中小工厂通过外贸综合服务企业或外贸代理公司出口,报关单上的经营单位是代理方,生产企业只体现在「生产销售单位」栏位,而这一栏位的可获得性和规范程度都不如经营单位。直接用报关主体统计出口企业,会把大量制造企业算成贸易企业。

一个可以对照的宏观数字:2025 年我国有进出口记录的经营主体超过 78 万家,其中民营企业进出口 26.04 万亿元,增长 7.1%,占进出口总值的比重提升至 57.3%。这 78 万家是「当年有报关实绩的主体」,其中包含大量纯贸易主体,同时不包含通过代理出口的生产企业。它与「有外贸业务的工厂数量」不是同一个概念,两者不能直接比较——这一点在本文第 21 章讨论口径时会再次提到。

第五类:知识产权信息。

包括专利、商标、软件著作权。专利的技术分类体系细致,能定位技术方向;商标能反映品牌布局;申请时间序列能反映研发投入的节奏。

系统性偏差是资质驱动。中国的专利申请中,有相当一部分是为了申报高新技术企业、专精特新、政府补贴而进行的,这类专利与实际生产的关联度较弱。判断依据可以参考:发明专利比实用新型更能反映真实技术积累;有持续多年申请记录的比集中在某一年突击申请的更可信;专利技术领域与其他信号(招聘岗位、产品词)一致的更可信。

第六类:企业自主披露的信息。

包括官网、公众号、展会资料、行业协会名录、认证证书公示。信息最贴近企业真实业务表述。

系统性偏差是幸存者偏差与营销偏差。做官网、参展、入会的企业,本身就是更重视市场推广的那一批;官网上的表述又倾向于夸大能力、展示最好的产品线。用这类信息刻画行业,会得到一个比现实更光鲜的画面。


把六类来源放在一起,可以得到一张偏差对照表:

来源 覆盖偏向 主要偏差 适合回答的问题
工商登记 全体主体 申报偏差 主体是谁、法律状态
招聘信息 中大型、扩张期 规模与周期偏差 是否在生产、工艺方向
招投标 面向体制内供货 领域偏差 交付能力、资质
进出口 有报关实绩主体 主体错位 产品品类、外贸能力
知识产权 有资质诉求企业 资质驱动 技术方向
自主披露 重视推广企业 幸存者与营销偏差 产品线、品牌定位

这张表最重要的用法是反向使用:当某个结论只由单一来源支撑时,先检查这个来源的偏差方向是否恰好会导致这个结论。

举个例子。如果只用招投标数据统计「某省电机行业的头部企业」,得到的名单会以给电网、轨交、国企配套的企业为主,而给家电、汽车零部件配套的大型民营电机厂可能一家都不在里面。这个名单不是错的,它准确回答了「谁在给体制内供货」,但它不能回答「谁是这个行业最大的企业」。

结论只有在多个偏差方向不同的来源同时支撑时,才是稳健的。这就引出了本部分的第二个主题。

十七、对齐:同一家工厂的十七个名字

汇聚之后是对齐。所有来源的数据都要挂到同一个主体上,否则它们就是六堆互不相干的文本。

对齐的技术名称是实体解析,工作内容是判断两条记录是否指向同一个现实实体。听起来像是字符串匹配,实际上要复杂得多。

先看一组真实场景中会遇到的名称变体。假设有一家企业,营业执照名称是「苏州市吴江区盛泽镇华鼎精密机械有限公司」,那么在不同来源里它可能以这些形态出现:

  • 苏州市吴江区盛泽镇华鼎精密机械有限公司(工商登记)
  • 苏州吴江华鼎精密机械有限公司(简写,去掉了「市」「区」「镇」)
  • 苏州华鼎精密机械有限公司(更简,去掉了区镇)
  • 华鼎精密机械(招聘平台的公司简称)
  • 华鼎机械(招投标公告里的简称)
  • 吴江华鼎(当地行业内的口头称呼)
  • HUADING PRECISION MACHINERY CO., LTD.(报关与外贸场合)
  • Huading Machinery(海外客户的写法)
  • 华鼎精机(行业展会展位牌的缩写)
  • 苏州市华鼎精密机械有限公司(历史曾用名,迁址前)
  • 华鼎精密机械(苏州)有限公司(另一种可能的登记形态)

再加上错别字、繁简体混用、全半角差异、公司后缀省略、行业词位置调换,同一家企业在数据世界里的名称变体轻易超过十种。

对齐要解决的就是把这些变体归到同一个主体上。可用的方法分三层。

第一层:强标识匹配。

如果两条记录都带统一社会信用代码,直接比对即可,这是最可靠的路径。可惜的是,六类来源里只有工商登记和部分招投标公告会带代码,招聘、展会、官网基本不带。

强标识还包括注册商标号、专利申请人名称加地址的组合、电话号码等。这些标识各有覆盖盲区,但只要命中就可靠。

第二层:规则化归一后的字符串匹配。

先对名称做标准化处理:统一繁简体和全半角、移除组织形式后缀、拆分出行政区划前缀、提取字号部分,然后比对核心字号加行业词。

这一层能解决大部分简写问题,但会引入新的风险:字号重名。全国叫「华鼎」的机械企业可能有几十家,仅凭「华鼎机械」四个字,无法确定是哪一家。因此规则匹配必须结合地域约束——如果两条记录的地域信息(哪怕只精确到地级市)冲突,即便字号完全相同也不能合并。

第三层:多特征联合判定。

当名称本身不足以判定时,引入其他特征做联合判断:地址的相似度、法定代表人姓名、电话号码、经营范围的重合度、产品词的重合度。多个弱特征的组合可以形成较强的判定。

这一层的工程实现通常是一个打分模型:每个特征贡献一个分值,超过阈值判为同一实体,低于另一个阈值判为不同实体,中间地带进入人工复核队列。


关于对齐,有三条经验值得单独写出来。

其一,宁可漏合并,不可错合并。

漏合并的后果是同一家企业在库里存在两条记录,用户会觉得数据有重复,体验受损但不致命。错合并的后果是两家不同的企业被并成一条,A 公司的联系方式挂到了 B 公司的名下——用户按这条记录打电话,接电话的是另一家企业。这种错误一旦发生,用户对整个数据源的信任会立刻崩塌,而且很难通过后续补救挽回。

因此对齐的阈值应当设得保守,把不确定的情况留在「疑似」状态,而不是强行合并。

其二,对齐结果必须可追溯、可撤销。

合并操作应当记录依据——是靠代码匹配的,还是靠打分模型判定的,用了哪些特征,得分多少。当后续发现某次合并是错的,需要能够精确地把它拆回去,而不是重新跑一遍全量。

其三,同名不同主体的判定,必须有地域约束参与。

这是最容易出错的地方。中文企业名称的字号重复率极高,尤其是那些寓意好的两字组合——鑫源、宏达、金鼎、永盛、恒昌。在没有地域约束的情况下用字号匹配,会制造出大量荒谬的合并结果。

十八、交叉:硬信号与软信号

对齐完成之后,一个主体身上会挂着来自六类来源的、彼此可能矛盾的信息。接下来的工作是判断哪些可信。

判断的基本框架,是把信号分成硬信号和软信号两类。

硬信号的定义是:伪造成本高于伪造收益,且与待判断的事实强相关。

以「这家企业是否真在生产」为例,几类典型的硬信号:

  • 持续的一线生产岗位招聘。发布招聘信息本身有成本(付费职位、简历处理、面试安排),而伪造一条「注塑机操作工」的招聘不产生任何收益。
  • 作为供应商的中标记录,尤其是标的需要提供生产资质、样品或现场核查的。
  • 需要实地核查的资质认定,如高新技术企业、专精特新「小巨人」、各类体系认证。
  • 需要付费和实物展品的专业展会参展记录。
  • 与生产强相关的行政许可,如涉及特定工艺的生产许可。

软信号的定义是:可以零成本声明,或与待判断事实只有弱相关性。

  • 经营范围中包含「制造」「生产」字样;
  • 企业名称中包含「制造」「实业」「工业」;
  • 官网上的自我描述、宣传图片;
  • 行业分类代码本身。

软信号不是没有用,它的作用是扩大候选范围;硬信号的作用是确认。正确的流程是先用软信号圈定候选池,再用硬信号做确认,而不是反过来。


交叉验证的具体做法,有三条原则。

原则一:独立性优先于数量。

三个来自同一数据源家族的信号,价值远低于两个来自完全不同来源的信号。比如「经营范围含制造」「企业名称含制造」「行业分类为 C」这三个信号,看起来是三条证据,实际上都来自工商登记这一个源头,它们之间高度相关——企业在登记时就是照着一套模板一起填的。三条一致的相关证据,提供的增量信息远小于「招聘信息显示在招工」加「中标记录显示交付过产品」这两条独立证据。

原则二:矛盾必须被记录,而不是被消除。

当两个来源冲突时,常见的处理方式是按优先级取其一,把另一条丢弃。这种做法在工程上简单,但会丢失重要信息。

更好的做法是保留矛盾,并把它作为一个独立的信号。举例来说,一家企业工商登记状态为「存续」,但社保参保人数连续两年为零、无任何招聘记录、无中标记录、官网无法访问——这四个信号与「存续」状态矛盾,而这个矛盾本身就是一个高价值判断:这家企业很可能已经实质停业。

如果按「工商信息权威性最高」的规则直接采纳「存续」,这个判断就永远做不出来。

原则三:给每一个结论标注置信度和依据。

一条「该企业为真实工厂」的结论,应当能回溯到具体依据:基于哪几条信号、每条信号来自哪个来源、采集于什么时间。当用户质疑或者结论被证伪时,能够定位到是哪一环出了问题。

这条原则的成本不低——它要求整个加工链路保留中间产物,而不是只保留最终结果。但它是数据产品能否被信任的分水岭。一个只能给出结论、无法给出依据的数据产品,在专业买家那里的定价会低得多。


最后讨论一个容易被忽视的问题:交叉验证的成本结构。

交叉验证的边际成本是递增的。要把工厂判定的准确率从 70% 提到 85%,可能只需要引入两类新的信号源;从 85% 提到 95%,需要引入五类,并且要处理大量的边界情况;从 95% 提到 99%,则可能需要引入人工核验,成本会跳一个量级。

因此,「做到多准」不是一个技术问题,而是一个由用途决定的经济问题。给宏观研究用的数据,85% 足够;给销售人员直接外呼用的名单,95% 是及格线;给金融机构做授信决策用的,99% 也可能不够,还需要现场尽调作为补充。

这个成本曲线,解释了产业数据市场为什么会自然分层——不同准确率的产品面向不同的用途,价格相差可以在一个数量级以上。

十九、大模型进入加工链路:能做什么,不能做什么

2023 年之后,大语言模型进入了产业数据的加工链路。这件事带来的变化是真实的,但也伴随着一类新的、隐蔽的风险。这一章分开讨论。

先说能做什么。

第一,从非结构化文本中抽取结构化信息,成本大幅下降。

在大模型之前,从一段企业简介中抽取产品名称,依赖的是规则加词典:先分词,再用预先构建的产品词典做匹配,配合正则规则处理常见句式。这套方法的天花板由词典的完备程度决定——词典里没有的产品词,永远抽不出来。而产品词是一个长尾极长的集合,新工艺、新材料、新叫法不断出现,词典永远追不上。

大模型改变了这一点。它能够在没有见过某个具体产品词的情况下,依据上下文判断「这是一个产品名称」。抽取的召回率因此有了实质性提升,尤其在长尾品类上。

第二,同义与上下位关系的处理变得可行。

「注塑模具」与「塑胶模具」是同义,「精密结构件」是「五金件」的一个子集,「PCD 刀具」属于「超硬刀具」——这类关系过去需要人工维护词典,现在可以由模型给出候选,人工做审核确认。工作量的性质从「创造」变成了「审核」,效率差别在一个数量级以上。

第三,用户意图的理解。

这是变化最大的一环。传统的产业数据检索,用户必须把需求翻译成系统能懂的筛选条件——选行业分类、填地区、勾选注册资本区间。而用户脑子里的原始需求是这样的:「我要找华东地区能做汽车用铝合金压铸件、有 IATF 认证、规模不用太大但要稳定的厂」。

把这句话翻译成筛选条件的过程,过去由用户自己完成,现在可以由模型完成。这不仅是交互方式的改进,它实际上改变了数据产品的形态——用户不再需要理解数据的组织方式,只需要描述需求。本文第 24 章会讨论这一改变的进一步后果。

再说不能做什么,这部分更重要。

第一,大模型不能用来生成事实。

这是一条不能让步的底线。模型可以判断一段文本里哪部分是产品名称,但不能被用来「推测」一家企业可能生产什么。前者是抽取,后者是编造。

在实践中,这条界线比想象中容易被越过。一个典型的越界场景是字段补全:某家企业的产品字段为空,而模型「知道」这类企业通常生产什么,于是给出一个看起来非常合理的填充值。这个填充值可能有 80% 的概率是对的——但剩下 20% 的错误,是无法被用户识别的错误,因为它看起来和真实数据完全一样。

数据产品一旦掺入这类无法识别的错误,它的可信度就不再是 80%,而是零。因为用户无法区分哪 80% 可信。

第二,抽取结果必须可回溯到原文。

防止越界的工程手段是要求每一个抽取结果都能定位到来源文本的具体位置。如果一个产品词无法在任何原始文本中找到出处,它就不应该进入数据库。这条约束会损失一部分召回,但它保证了库里的每一条信息都有据可查。

第三,模型不能替代口径定义。

模型可以判断一段文本描述的是不是一家工厂,但「什么算工厂」这个定义必须由人来给,并且必须写下来。如果把定义交给模型隐式决定,那么同一批数据在不同时间、用不同版本的模型处理,会得到不一致的结果,而且没有人能解释为什么不一致。

第四,成本结构需要重新设计。

对几百万条记录逐条调用大模型,成本不是小数目。可行的做法是分层:用低成本的规则和小模型完成粗筛,把大模型用在真正需要语义判断的那一小部分上;对结果做缓存,相同输入不重复计算;对长尾和高价值样本采用不同的处理精度。

这里有一个容易被忽略的经济学问题:大模型让加工的边际成本从「人力」变成了「算力」,但没有让它变成零。 而算力成本是随调用量线性增长的,不像软件那样有规模效应。这意味着以大模型为核心的数据加工业务,成本曲线更接近服务业而不是软件业,定价模型也必须相应调整——本文第 23 章会回到这一点。

最后是合规维度。

面向公众提供生成式人工智能服务,在中国需要履行备案或登记程序。据国家网信办公布的数据,截至 2026 年 6 月 30 日,累计有 988 款生成式人工智能服务完成国家层面备案,598 款生成式人工智能应用或功能完成地方层面登记。对于把大模型能力嵌入数据产品对外提供的机构,这是必须完成的合规前置动作,而不是可选项。

二十、度量:三个维度与一种伪精度

一份产业数据「好不好」,需要能被度量。没有度量,改进就无从谈起,定价也失去依据。

产业数据的质量可以拆成三个维度,它们相互独立,不能互相替代。

维度一:覆盖率。

即目标总体中有多少被收录。覆盖率的困难在于分母——如果连总体有多少都不知道(这正是序章那个问题),覆盖率就无法直接计算。

可行的替代做法是抽样估计:在某个可以穷举的小范围内做全量核对,再外推。比如选定一个县级行政区的某个细分行业,用实地走访或工商全量名录做基准,核对数据库的收录情况,得到该切片的覆盖率,再在多个切片上重复。这个方法成本高,但它是唯一能给出可信覆盖率的方法。

维度二:准确率。

即收录的记录中有多少是对的。准确率必须分字段度量,因为不同字段的准确率差异极大——统一社会信用代码的准确率可以接近 100%,产品品类可能只有 80%,联系人有效率可能更低。

给出一个总体的「数据准确率 98%」是没有意义的表述,它掩盖了字段之间的巨大差异。有意义的表述是分字段的、带核验方法说明的准确率。

维度三:新鲜度。

即记录距离上次核验过了多久。如第 15 章所述,不同字段的半衰期差异很大,因此新鲜度也必须分字段度量。

一个实用的做法是给每条记录的每个关键字段附带「最后核验时间」,并在产品界面上向用户展示。这看起来是在暴露自己的短板,实际上是在建立信任——用户知道一条联系方式是三个月前核验的,会自行调整预期;而如果不展示,用户会默认它是最新的,一旦失效就会归咎于整个数据源。


三个维度之外,还要警惕一类特殊的质量问题:伪精度。

伪精度指的是给出了一个看起来很精确、实际上没有依据的数字。产业数据中最常见的三种伪精度:

第一种是精确的总数。 检索结果显示「共找到 12,847 家符合条件的企业」,这个数字精确到个位。但如果筛选条件里包含「能做医疗级注塑」这种需要语义判断的维度,那么这个总数的精度完全取决于判断的准确率——如果判断准确率是 80%,那么真实数字可能在 10,000 到 15,000 之间,报出 12,847 就是伪精度。

诚实的做法是要么给出区间,要么明确标注这个数字的口径是「按当前判定规则命中的记录数」,而不是「真实存在的企业数」。

第二种是精确的排名。 「某某行业企业实力排行榜第 37 名」——如果排名依据的是几个可得性有限的公开字段的加权,那么第 37 名和第 52 名之间的差异可能完全在噪声范围内。

第三种是精确的估算值。 「该企业年产能约 8600 吨」——如果这个数字是由厂房面积、设备数量、行业平均单位产出推算出来的,那么它的误差范围可能达到正负 50%,写成 8600 吨给了读者不该有的信心。

伪精度比明显的错误更有害,因为它不会触发怀疑。识别伪精度的方法只有一个:追问这个数字是怎么算出来的,以及它的误差来源是什么。 如果回答不上来,这个数字就不该出现在产品里。

二十一、口径:每个数字都必须挂一个定义

本章讨论一个看起来是文风问题、实际上是方法论核心的问题:产业数据的每一个数字,都必须附带口径说明。

先看三组具体的例子。

例一:中国有多少家制造企业?

  • 截至 2025 年末,全国规模以上工业企业约 43.6 万家(国家统计局口径,年主营业务收入 2000 万元及以上的工业法人单位,含制造业、采矿业、电力热力燃气及水生产供应业三大门类);
  • 截至 2025 年 5 月 31 日,我国制造业企业总数 246 万家(全国组织机构统一社会信用代码数据服务中心口径,登记行业门类为制造业的企业法人,不设营收门槛);
  • 若把有实际生产活动、但登记为个体工商户或登记在其他行业门类的主体也计入,数字还会更大。

三个数字都是对的,因为它们回答的是三个不同的问题。43.6 万回答的是「有多少家达到统计门槛的工业法人」,246 万回答的是「有多少家登记为制造业的企业法人」,第三个口径回答的是「有多少个实际在生产的经营单位」。

商业实践中使用的通常是第三类口径。天下工厂产业平台对外披露的工厂库规模为 480 万家,其口径是「经多源信号判定具有实际生产活动的经营主体档案」,判定对象既包含企业法人,也包含具有生产活动的其他经营主体形态,同时不以登记行业门类是否为制造业作为唯一依据。这个口径与 246 万的差异,主要来自三部分:登记为个体工商户的加工主体、登记行业门类不在制造业但实际有生产的主体、以及多厂区主体的计数方式。

把三个口径并列写出来,比只报一个数字更有价值。因为读者真正需要知道的不是「哪个数字对」,而是「哪个数字回答了我的问题」。

例二:中国有多少家做外贸的工厂?

  • 2025 年我国有进出口记录的经营主体超过 78 万家(海关总署口径,当年有实际报关记录的主体,含纯贸易主体,不含通过代理出口的生产企业);
  • 天下工厂平台对外披露的「有外贸业务的工厂」为 108 万家,口径是「存在外贸业务迹象的工厂档案」,迹象包括历史报关记录、外文站点、跨境平台经营、参加境外展会、海外客户往来等,不要求当年有报关实绩,也不要求报关主体是本企业。

108 万大于 78 万,不是因为哪一方统计错了,而是因为两个口径的包含关系不同:海关口径要求「当年、本主体、有报关」,平台口径要求「具备外贸能力或历史」。前者严格,后者宽泛。

如果不说明口径,把两个数字并列,读者会得出「数据打架」的结论。说明了口径,读者就能自己判断该用哪一个——做年度外贸形势分析用 78 万,做外贸型工厂的市场规模估算用 108 万。

例三:多少家工厂有决策人联系方式?

同一份数据,可以有至少三种表述:

  • 按「存续状态且存在直连电话」统计,是一个数字;
  • 按「存在明确标记为决策人的联系方式」统计,是另一个更小的数字;
  • 按「联系方式经过近期核验且有效」统计,是第三个更小的数字。

对外披露时选择哪一个,是一个诚信问题。选最大的那个不违法,但会造成用户预期与实际体验的落差。天下工厂平台在对外表述中采用的是「超过 300 万家」这一相对保守的口径,并明确说明其含义是「带有决策人直连联系方式的工厂档案数量」,而不是「拨通即有效的号码数量」。


从这三个例子可以抽出口径表述的三个必要要素:

要素一:统计对象。 统计的是企业法人、经营主体、还是工厂档案?包含哪些形态,排除哪些形态?

要素二:时间点与时间窗。 是某个时点的存量,还是某个时间窗内有行为的流量?「当年有报关记录」和「历史上有过报关记录」是完全不同的两个集合。

要素三:判定标准。 对于需要判断的属性(是不是工厂、有没有外贸、是不是决策人),判定规则是什么?规则的准确率如何?

三个要素缺一个,数字就会失去可比性;三个都缺,数字就只是一个用于宣传的符号。


最后要说明的是,口径纪律不只是对外表述的规范,它首先是内部方法论的规范。

一个组织如果内部没有统一的口径定义,那么不同部门、不同时期算出来的同一个指标会互相矛盾,而且没有人能解释矛盾从何而来。当矛盾出现时,最常见的处理方式是选一个「看起来对」的数字继续用,问题被掩盖而不是被解决。

产业数据加工是一项长期工程,其可靠性建立在定义的稳定性上。定义可以修改,但每次修改都必须留痕,并且能够说明修改前后的差异。这一点,与其说是数据治理,不如说是研究纪律。

第四部分 流通的形态

前三部分讨论的是数据如何被加工出来。这一部分讨论加工完成之后,它以什么形态被交付、如何定价、卖给谁、以及边界在哪里。

二十二、三种交付形态

同一份工厂数据,可以有三种完全不同的交付形态。它们的差别不只是技术接口的差别,而是权属结构、计价方式、风险分配的根本差别。

形态一:数据集交付。

买方付一笔钱,卖方交付一批数据文件,买方拿走。这是最传统的形态,也是大多数人想象中「数据交易」的样子。数据交易所挂牌的产品,相当一部分属于这一类。

这种形态有三个固有问题。

第一,权属边界模糊。数据交付之后,卖方对它失去了任何控制。买方可以复制、可以转售、可以整合进自己的产品。合同上可以约定用途限制,但执行成本极高,事实上无法监督。

第二,无法复用定价。同一份数据卖给第二个买家时,第一个买家的存在会削弱它的价值;而卖方无法阻止第一个买家把数据再卖一遍。这导致数据集交付的定价必须一次性覆盖全部成本,价格高,成交少。

第三,新鲜度立刻开始衰减。交付那一刻数据就定格了,而如第 15 章所述,工厂数据中最有价值的几个字段月级别就会失效。买方拿到的是一份不断贬值的资产。

从三权分置的框架看,数据集交付本质上是把持有权、加工使用权、经营权一次性全部转移了出去——这恰恰是「数据二十条」希望避免的模式。

形态二:查询界面交付。

卖方提供一个软件界面,买方登录之后检索、筛选、查看、导出。计价方式通常是会员订阅加使用配额。这是目前企业信息服务市场的主流形态。

相比数据集交付,它的进步在于:数据留在卖方手里,交付的是使用权;可以按使用量控制;可以持续更新,买方每次看到的都是最新状态。

它的局限在于,交付对象是人。人通过界面获取信息,再手工把信息转移到自己的工作流里——复制到表格、粘贴进 CRM、整理成拜访清单。这个环节的效率损耗很大,而且规模上不去:一个人一天能看几百条记录,看不了几万条。

形态三:接口调用交付。

卖方提供程序接口,买方的系统直接调用,按调用次数计费。交付对象是机器。

这种形态的特性与前两种都不同:

  • 数据不转移。 每次调用返回的是针对特定请求的结果,而不是数据集本身。持有权留在卖方,买方获得的是加工使用权。这一点与三权分置的制度设计天然吻合。
  • 计量精确。 每一次调用都是一个可计量、可计费、可审计的事件。这解决了数据定价中最难的问题——如何度量使用量。
  • 可以嵌入买方的业务流程。 买方不需要改变自己的工作方式,数据在它需要的那个环节自动出现。
  • 风控可以做到调用级。 频率限制、字段级权限、异常行为检测,都可以在每一次调用上执行,而不是事后追责。

值得注意的是,2025 年 1 月国家发展改革委与国家数据局印发的公共数据资源授权运营价格形成机制文件中,明确把「数据调用量」列为可选的收费形式之一。官方定价文件承认按调用量计费,是对这种形态的制度确认。


三种形态不是相互替代的关系,它们服务不同的场景:

形态 交付对象 权属变化 计价单位 主要风险
数据集 系统(一次性) 全部转移 一口价 转售失控、迅速过期
查询界面 人 使用权 席位+配额 规模受限、导出泄漏
接口调用 机器 使用权 每次调用 依赖可用性、成本随量增长

但从趋势看,重心正在向第三种转移。原因不在于技术偏好,而在于需求侧发生了变化——买方越来越多的不是「想看数据的人」,而是「需要数据的系统」。这一点在下一章和第 24 章会展开。

二十三、定价:一次调用值多少钱

数据产品定价是整个数据要素市场最缺乏公开信息的环节。交易所挂牌产品的价格通常不公开,企业间的场外交易价格更是商业秘密。这导致市场缺少价格发现机制,新进入者无从判断自己该定多少钱。

本章尝试从三个锚点讨论定价,并给出一组可公开查证的实际价格作为参照。

锚点一:成本。

公共数据授权运营的定价方法已经在第 4 章介绍过:准许收入等于经营成本加准许利润,准许利润率按成本调查前一年 10 年期国债平均收益率加不超过 6 个百分点确定。

这个方法适用于受管制的公共数据,但它提供的成本清单对市场化产品同样有参考价值。清单里的五项——平台建设运维、数据传输汇聚存储治理、人力、数据获取支出、期间费用——基本涵盖了数据加工的全部开销。

从成本结构看,产业数据产品有一个显著特征:固定成本极高,边际成本低但不为零。

固定成本包括建立采集体系、构建加工链路、维护同义词与分类体系、持续核验存量数据。这些开销与卖出多少次基本无关。边际成本包括每次调用的算力、带宽、以及涉及大模型时的推理开销。如第 19 章所述,大模型的引入让边际成本从趋近于零变成了一个不可忽略的量。

高固定成本加低边际成本的结构,意味着定价必须依赖足够的调用量来摊薄固定成本。这也解释了为什么这个行业的集中度会自然提高——规模小的参与者摊不平固定成本。

锚点二:替代方案的成本。

数据产品的价值上限,是买方自己解决同一问题的成本。

以「找到一家符合条件的工厂并联系上决策人」为例,如果不借助数据产品,可行的替代方案包括:参加行业展会(展位费加差旅,单次投入通常在数万元量级,能接触的有效对象有限)、通过搜索引擎逐个筛选(人力时间成本高,且如第 10 章所述,公开搜索无法判断对方是不是真工厂)、购买展会名录或行业协会名录(一次性数据集交付,存在第 22 章讨论的全部问题)、委托第三方做定向调研(单家成本高,适合少量重点目标)。

把这些替代方案的成本换算到「每获得一个合格线索」的单位上,量级通常在几十元到几百元之间,视行业和线索质量而定。这个量级就是数据产品定价的天花板参照。

锚点三:可公开查证的实际价格。

为了给市场提供一个具体的参照,这里引用一组公开发布的接口定价。天下工厂开放平台对其五项能力的公开计价如下(按 1 元等于 2000 credits 换算):

  • 工厂检索:400 credits,约 0.2 元/次
  • 企业详情:200 credits,约 0.1 元/次
  • 联系方式:400 credits,约 0.2 元/次
  • 深度尽调:500 credits,约 0.25 元/次
  • 智能体检索:200 credits,约 0.1 元/轮

同时公开的还有几条计费规则:同一家企业的联系方式第二次调用不重复计费;调用失败不计费;每一次调用产生独立的审计记录。

这组数字之所以值得引用,不在于它是否是市场的普遍水平——单一来源不能代表市场——而在于它把几件通常被隐藏的事情写在了明面上:单价、计费单位、去重规则、失败处理。

其中「失败不计费」和「重复调用不重复计费」这两条规则,比单价本身更值得讨论。它们回答的是数据交易中最容易产生争议的问题:如果我付了钱但没拿到有用的结果怎么办?如果我不小心查了两次同一家企业怎么办?

在数据集交付的形态下,这两个问题无法回答——数据已经交付了,好用不好用是买方的事。而在按次调用的形态下,它们可以被写成明确的规则,并且由系统自动执行。

这就引出了按次计价的深层价值:它把「数据好不好用」这个模糊的质量问题,转化成了一组可以写进规则、可以自动执行、可以事后审计的具体条款。 信任不再依赖承诺,而是依赖机制。


关于定价,最后讨论一个结构性问题:谁为加工买单?

在数据集交付的模式下,加工成本由第一个买家承担——他付的价格必须覆盖全部加工投入。这导致定价虚高,成交困难。

在按次调用的模式下,加工成本由所有调用者分摊。单次价格可以很低,靠调用量累积回本。这个模式对卖方的要求是:必须先垫付全部加工成本,再等待调用量长出来。垫付期可能长达数年。

这就是第一公里最核心的经济学问题:加工是一项前置的、重资产的、回收周期长的投入,而现有的制度激励主要落在流通环节和资产化环节,没有落在加工环节。 本文第 32 章会回到这个问题。

二十四、接口的重写:当调用方从人变成模型

2024 年 11 月,Anthropic 提出了模型上下文协议(Model Context Protocol,MCP),用于规范大模型与外部数据、工具之间的调用行为。此后一年多时间里,这个协议被主流的模型客户端和开发工具广泛采纳,成为事实标准之一。

对数据供给方而言,MCP 的意义不在于协议本身有多先进,而在于它标志着数据的主要消费者正在从人变成模型。

这个转变的后果比看起来大。

第一,接口的设计目标变了。

面向人的接口,设计目标是易于理解:界面清晰、术语友好、结果可读。面向模型的接口,设计目标是确定性:输入参数的语义必须无歧义,返回结构必须稳定,错误情况必须有明确编码,边界条件必须被定义。

模型不会像人一样「大概猜一下这个字段是什么意思」——或者更准确地说,模型会猜,而且猜错了不会告诉你。因此面向模型的接口必须把人可以靠常识补全的部分全部显式化。

第二,数据供给成为对抗幻觉的手段。

大模型最被诟病的问题是幻觉——在不知道答案时生成看起来合理的内容。在企业信息这类场景中,幻觉的危害尤其严重:模型编造一家不存在的供应商、编造一个错误的联系方式、编造一份不存在的资质,用户很难当场识别。

解决幻觉的根本办法不是让模型更聪明,而是给它接上真实数据源。当模型可以调用一个返回真实工厂记录的接口时,它就不需要靠记忆去回答「江苏有哪些做精密齿轮的厂」。

这意味着数据供给方在 AI 时代获得了一个新的角色定位:它不只是数据的卖方,它是模型可信度的一部分。这个定位的商业含义相当不同——模型的每一次调用都是数据方的一次计费事件,而模型的使用频率远高于人。

第三,市场上已经出现了具体的实践。

企业信息服务领域已经出现了面向智能体的产品形态。2026 年,企查查推出智能体数据平台,其 MCP 接入覆盖 179 个原子能力,包括工商、司法、知产、经营、董监高等高频维度。天下工厂开放平台则采用 MCP 与 REST 双门面的方式提供工厂检索、企业详情、联系方式、深度尽调、智能体检索五项能力,两种门面共用同一套处理链路、计费规则与审计体系。

这两个案例代表了同一个方向:把数据能力拆解成可被模型直接调用的原子操作,而不是提供一个需要人来操作的界面。

第四,对数据质量的要求提高了,而不是降低了。

有一种误解认为,模型可以容忍脏数据,因为它有推理能力可以自行纠正。实际情况相反。

人在使用数据时会自带判断:看到一条明显不对劲的记录,会跳过它;看到两条矛盾的信息,会去核实。模型不会——它会把返回的内容当作事实,纳入推理,然后基于错误的前提给出结论。而且这个结论会以流畅、自信的语言呈现,比原始的错误数据更具误导性。

错误数据经过模型之后,不会被稀释,只会被放大。 这是数据供给方在智能体时代面临的最大压力,也是第 20 章讨论的质量度量为什么变得更重要的原因。


从更长的视角看,接口形态的变化对应着数据产品价值链位置的变化。

在查询界面的时代,数据产品是一个独立的应用,用户需要专门打开它、专门去用它。它在用户的工作流之外。

在接口调用的时代,数据产品沉到了底层,成为其他应用的一个组成部分。用户可能根本不知道自己在使用它——他只是在自己的系统里问了一个问题,答案来自某个他没听说过的数据源。

这个位置的变化,既是机会也是风险。机会在于调用量可以远超界面时代;风险在于品牌与用户之间隔了一层,议价能力取决于是否不可替代。

而是否不可替代,最终又回到了第一公里:数据本身是不是别人做不出来。

二十五、谁在买:三类需求方

数据产品的形态和定价确定之后,还剩一个问题:谁付钱。

工厂数据的需求方可以分成三类。它们的付费逻辑完全不同,理解这个差异,比讨论市场规模有用得多。

第一类:向工厂销售的人。

这是数量最大、也最容易被低估的一类。

中国有 1.8 亿户经营主体,其中制造业企业 246 万家(按前述统一社会信用代码数据服务中心口径)。围绕这几百万家工厂,存在一个庞大的供给侧市场:工业原材料、机床与自动化设备、工业软件(ERP、MES、PLM)、工业气体与化学品、包装材料、物流与仓储、供应链金融与保险、检测认证咨询、人力与招工服务、能源管理、环保设备。

这些行业的共同点是:客户是工厂,销售方式以主动开发为主,成交周期长,客单价从几万元到几千万元不等。它们的销售人员每天面对的核心问题是——下一家该找谁。

这个问题的答案就是一份名单。名单的质量直接决定销售效率:名单里混入贸易公司,电话白打;名单里的工厂规模不匹配,产品卖不进去;名单里没有决策人联系方式,卡在前台。

这类买家的付费心智接近于线索采购。他们会用「每获得一个有效商机花了多少钱」来衡量投入产出,对单价敏感度中等,对有效率敏感度极高。以天下工厂平台披露的用户结构,其注册的 B2B 销售人员规模为 10 万人以上。

这一类需求在过去长期被低估,原因是它分散在几十个上游行业里,没有一个统一的名字。它不叫「工业互联网」,也不叫「产业数字化」,它只是无数个销售部门每天都要解决的具体问题。

第二类:寻找工厂的人。

包括采购寻源、供应商核验、供应链合规审查、验厂前的背景调查。买家包括品牌商、贸易商、跨境电商卖家、大型企业的采购部门、以及需要做供应链尽调的机构。

这一类的付费逻辑是风险规避。他们要回答的问题不是「谁可以合作」,而是「这一家能不能合作」——对方是不是真有产能、有没有司法风险、资质是不是真的、规模够不够承接订单。

单次决策的金额通常远高于第一类,因此对数据单价的敏感度低,对准确性和可核验性的要求高。他们愿意为「能追溯到原始出处的信息」付溢价,因为出了问题需要向内部交代。

值得注意的是,采购侧需求在过去几年被中国的产业数据服务商普遍低估或者刻意回避——因为「找供应商」这件事在心智上被交易平台占据了。但交易平台解决的是「在平台内的商家中挑一个」,而采购方真正需要的往往是「在全国范围内找出所有可能的候选,再判断哪些值得接触」。后者是数据问题,不是交易问题。

第三类:把数据接进自己产品的人。

包括软件开发者、行业 SaaS 厂商、AI 应用开发者、以及企业内部的信息化团队。他们不直接使用数据,而是把数据能力嵌入自己的产品,服务自己的用户。

这一类的付费逻辑是单位调用成本。他们会精确计算:我的产品每服务一个用户,需要调用多少次数据接口,单次成本是多少,这个成本占我产品定价的比例是否可接受。

他们对价格极其敏感,但对量的贡献最大。而且一旦接入并跑通,迁移成本高,粘性强。

这一类需求的规模在过去两年快速增长,直接原因是 AI 应用的爆发。如第 24 章所述,模型需要真实数据源来抑制幻觉,而绝大多数应用开发者不可能自己去建一套工厂数据库。


三类需求方的差异可以概括成一张表:

需求方 核心问题 付费逻辑 价格敏感度 质量诉求
向工厂销售 下一家找谁 线索单位成本 中 有效率、联系人可达
寻找工厂 这一家能不能合作 风险规避 低 准确、可追溯
接入数据 每次调用多少钱 单位调用成本 高 稳定、结构化、可预期

从数据加工的角度看,三类需求方对同一份底层数据提出了不同的要求,但它们共享同一层加工成果。这是产业数据业务能够成立的关键——如果每一类需求都需要独立建一套数据,成本无法覆盖;正因为底层是同一层,加工的固定成本才能被三类需求共同摊薄。

这一点也解释了为什么产业数据的组织方式,应当以「主体」为中心,而不是以「场景」为中心。以主体为中心,一家工厂的档案可以被销售、采购、开发者反复使用;以场景为中心,每个场景各建一套,最后会得到几套互相矛盾、都不完整的数据。

二十六、边界:公开不等于可用

产业数据加工无法回避一个问题:从公开渠道获取信息,法律边界在哪里。

这个问题在中国已经有了相当清晰的司法答案,但答案与很多人的直觉不同。核心结论是:信息公开,不等于可以随意采集和商业化使用。

先看竞争法维度。

司法实践普遍认可,企业对其合法收集、整理,并能带来增值利润与竞争优势的数据资源整体,享有受《反不正当竞争法》保护的竞争性权益。也就是说,即便原始信息本身是公开的,经过系统性采集、清洗、结构化处理形成的数据集合体,其商业价值仍然受法律保护。

近期的司法实践中已经形成了一个可操作的审查框架,即「三阶审查」:

第一阶,技术手段的合法性筛查。 采集行为是否突破了对方的技术措施、是否违反了机器人协议、是否对对方的服务器造成了实质性负担。使用「暴力爬取」手段、绕过反爬机制、造成对方服务不稳定的,在第一阶就会被否定。

第二阶,竞争目的的合理性评估。 采集来的数据用于什么。用于新的服务、产生了新的价值,与直接复制对方产品替代其市场,评价完全不同。未付出实质性对价、大规模抓取并直接商业化使用、分流对方用户流量、掠夺其交易机会的,会被认定主观存在恶意。

第三阶,损害后果的实质性认定。 除了直接的经济损失,还要考虑非物质的竞争损害——数据资产贬值、用户粘性下降、权利人对数据开发衍生产品的交易机会被削弱。

在具体案例中,法院曾认定被告未付出实质性对价、大规模抓取新闻数据并商业化使用的行为构成不正当竞争;也曾在另一起案件中认定爬虫行为具有主观过错、违背诚信原则,判决赔偿经济损失及维权费用 50 万元。

这个框架的意义在于,它既避免了简单否定技术创新,又有效遏制了「不劳而获」的搭便车行为。对数据加工者的启示是明确的:价值必须来自自己的加工,不能来自对他人加工成果的复制。

再看公共数据维度。

公共数据开放同样不等于无序滥用。企业超范围抓取、篡改加工、违规商用、过度传播,依然会构成侵权。一般的判断标准是:如实客观地加工不构成侵权,篡改失真、误导公众、恶意牟利则会构成不正当竞争。

这里有一条容易被忽略的红线:加工不能改变事实。 把一家企业的公开信息重新组织、分类、标注、关联,是合法的增值加工;而修改数值、编造评级、伪造资质、制造误导性的对比,即便原始数据来自公开渠道,也会越界。

最后看个人信息维度。

如第 13 章所述,工作场景中的联系方式在法律性质上属于个人信息。《个人信息保护法》允许在合理范围内处理个人自行公开或者已经合法公开的个人信息,但「合理范围」需要个案判断,而且个人有权明确拒绝。

实务中的稳妥做法,是把合规当成产品设计的一部分而不是事后的补丁:

  • 来源限定。 只处理商务场景下已经公开的信息,明确排除私人生活场景。
  • 最小必要。 只采集业务确实需要的字段,不因为「以后可能有用」而扩大采集范围。
  • 脱敏存储与按权限解锁。 不提供可自由传播的明文批量清单,每一次解锁都对应一个具体的业务场景和一个可识别的使用者。
  • 全程审计。 每一次查询、每一次解锁、每一次导出都留痕,做到可追溯。
  • 有效的异议渠道。 个人提出删除或更正请求时,能够实际执行并在合理时间内完成。

关于合规,最后想说一个反直觉的判断:合规成本是这个行业护城河的一部分。

一家愿意投入建设脱敏体系、权限体系、审计体系、异议处理流程的机构,其单位数据成本必然高于一家直接批量倒卖明文清单的机构。在短期的价格竞争中,前者处于劣势。

但产业数据是一门长期生意。它的价值建立在持续采集、持续核验、持续更新之上,任何一次严重的合规事故都可能导致业务中止。而监管的方向是持续收紧的——从《网络安全法》到《数据安全法》《个人信息保护法》,再到数据要素领域的一系列专项规定,边界只会越来越清晰、执行只会越来越严。

因此在这个行业里,合规投入不是成本项,而是期权:它买的是继续经营的权利。这一点,与制造业中安全生产投入的性质是相似的。

第五部分 参照系

讨论到这里,有必要把中国的情况放进一个更长的时间尺度和更大的空间范围里看。产业数据这门生意不是 2020 年代的新发明,它有将近两百年的历史;而中国在这条路上走的路径,与其他国家有明显的不同。

二十七、一枚编码的一百八十年

1841 年 7 月 20 日,刘易斯·塔潘(Lewis Tappan)在纽约创办了一家名为 The Mercantile Agency 的机构。它要解决的问题非常具体:当时的美国商业依赖赊销,一个纽约的批发商把货发给俄亥俄州的一家零售店,几个月后才能收到钱。他怎么知道对方还得起?

塔潘的办法是建立一个通讯员网络。他在各地聘请当地的律师、银行家、商人作为通讯员,定期报告本地商户的经营状况、信誉、资产情况。这些报告汇总到纽约,形成一套可供查询的信用档案。

这套机制的本质,是把分散在无数个本地社区里的隐性知识,转化成可以远距离传递的显性信息。它解决的不是信息不存在的问题——每个镇上的人都知道谁的生意做得好、谁欠钱不还——而是这些信息无法离开本地的问题。

这与本文讨论的第一公里,是同一件事。

1859 年,罗伯特·格雷厄姆·邓(Robert Graham Dun)接手运营这家机构。1933 年,R. G. Dun 公司与 The Bradstreet 公司合并,成为 Dun & Bradstreet,中文译作邓白氏。

真正让这家公司从「一家做信用报告的公司」变成「一项基础设施」的,是 1963 年推出的邓白氏编码(D-U-N-S Number)。

这是一个 9 位数字的编码,为每一个企业实体分配一个全球唯一的标识。它的设计逻辑很简单,但影响深远:在任何跨系统、跨国界的商业往来中,先解决「你是谁」这个问题。

编码推出之后发生的事情,是典型的网络效应。越多的机构使用这个编码,它的价值越高;价值越高,越多的机构采用。到今天,多个国际组织,以及欧盟、美国、日本、中东等国家和地区的政府机构,把邓白氏编码作为企业注册或者通关时必须提供的信息之一。

一家私营公司发明的编码,成为了各国政府认可的企业身份标识——这件事本身值得琢磨。它说明标识符这类基础设施的形成,不一定需要自上而下的强制,也可以由市场需求自然积累。

今天的邓白氏,商业数据库覆盖全球超过 6 亿家企业信息,业务运营覆盖 200 多个国家和地区,服务全球超过 20 万家客户,其中包括超过 90% 的世界 500 强企业。2024 财年营收为 23.8 亿美元。2025 年 8 月 26 日,私募机构 Clearlake Capital 完成了对邓白氏的收购,这家在纽约证券交易所上市多年的公司重新回到私有化状态。

在中国,邓白氏的历史也不短:1981 年起进入中国市场;2009 年推出邓白氏注册服务;2017 年成为我国首家经央行备案的外资征信机构;2022 年在海南设立公司;2025 年成为国内首批增值电信业务扩大对外开放试点经营企业之一。

从第一公里的角度看,邓白氏这一百八十多年提供了三条经验。

第一,数据业务的护城河来自持续核验,而不是一次性采集。

邓白氏对外强调的核心能力不是数据规模,而是被称为 DUNSRight 的质量流程——对每天收集的原始数据进行编辑及核实。这是一套持续运行的作业流程,而不是一个数据库快照。

这与本文第 15 章的结论一致:产业数据的竞争最终落在运营能力上。规模是一次性投入可以达到的,准确率和新鲜度只能靠长期投入维持。

第二,标识符是最有价值的一层,也是最难建立的一层。

邓白氏编码的商业价值,远大于任何一份具体的信用报告。因为一旦成为通用标识,它就变成了整个商业网络的公共参照系,所有其他数据都要挂在它上面。

中国在这一层做得其实很好——统一社会信用代码是一次成功的国家级标识符治理,覆盖率和权威性都高于任何商业方案。但如第 8 章所述,它解决的是法律身份的唯一性,没有解决产业属性的可用性。

第三,行业的自然形态是长周期、低增速、高壁垒。

一百八十四年,营收 23.8 亿美元。这不是一个爆发式增长的行业。它的价值来自长期积累形成的不可替代性,而不是短期的规模扩张。

理解这一点,对于评估中国的产业数据机构很重要——用互联网行业的增长曲线去要求这门生意,会导致战略变形。

二十八、中国的信息中介简史

中国解决同一个问题的路径,与美国完全不同。

第一阶段:纸质商情(1990 年代前期至中期)。

1992 年,郭凡生用 7.4 万元创办慧聪,最初的产品是一本油印的《慧聪商情广告》小册子——把中关村家电、计算机经销商的报价信息收集起来,分类加工,面向市场发行。员工骑着自行车,从中关村跑到前门大栅栏,一家一家去收集和推销。到 1997 年,慧聪已经为三十个行业提供商情和黄页服务。

同一时期,1995 年,马云创办了「中国黄页」,把中国企业的信息做成网页放到互联网上。

这两个起点非常能说明中国路径的特点:它们从一开始就是面向交易的信息服务,而不是面向信用的评估服务。

美国的邓白氏起源于赊销信用问题——买方要评估卖方的偿付能力。中国的商情起源于供需匹配问题——买方要知道谁在卖、卖多少钱。前者关心「这家企业可不可靠」,后者关心「这家企业有没有我要的货」。

这个起点的差异,决定了后续四十年的分岔。

第二阶段:B2B 网络平台(1999 年至 2010 年代)。

1999 年阿里巴巴成立,随后推出诚信通、中国供应商等产品;慧聪在 2003 年 12 月于香港上市,2004 年完成从以刊为主向以网为主的转型;中国制造网、环球资源等平台先后进入市场。

这一阶段的商业模式是会员费加广告:工厂付费成为平台会员,获得展示位置和询盘机会。平台的核心资产是流量和商家规模,而不是数据质量。

这个模式在很长时间里运行良好,但它有一个内在的限制:平台只掌握「愿意付费入驻的企业」的信息,不掌握「所有企业」的信息。 一家不做线上推广、只服务几个固定大客户的优质工厂,在平台上不存在。

而中国制造业的大量优质产能,恰恰属于后一类。

第三阶段:企业信息查询工具(2014 年前后至今)。

随着国家企业信用信息公示系统的建立和工商数据的开放,一批企业信息查询平台出现。目前形成了以企查查、天眼查、爱企查、启信宝为代表的市场格局。

这一阶段的产品逻辑是工商数据的可视化与结构化:把分散在公示系统里的登记信息、司法信息、知识产权信息、招投标信息集中起来,提供检索和关系图谱。

商业上,这是一个相当成功的品类。以企查查为例,其在寻求上市时披露的营收为 7.08 亿元人民币(2024 年口径)。作为对照,同期邓白氏全球营收为 23.8 亿美元。两者的体量差距,背后是中国 1.8 亿户经营主体、全球第二大经济体尚未被充分定价的企业数据服务市场。

2026 年,这个品类开始向智能体方向演进——企查查推出智能体数据平台,其 MCP 接入覆盖 179 个原子能力,涵盖工商、司法、知产、经营、董监高等维度。

第四阶段:面向产业属性的数据加工(正在发生)。

工商类查询工具解决了「这家企业的法律状态和风险」,但如本文第 10 章所述,它们无法回答「这家企业是不是工厂、在造什么、产能多大」。

原因不是技术能力不足,而是数据源的性质决定的:工商数据本身不包含产业属性。要回答产业问题,必须引入工商体系之外的信号——招聘、招投标、报关、专利、展会、官网——并且要做本文第三部分讨论的那一整套加工。

这构成了当前正在形成的第四阶段。天下工厂产业平台是这一阶段的实践者之一,其对外披露的工厂库规模为 480 万家,细分行业类目 1965 个,覆盖产业带 1000 个以上。与前三个阶段相比,它的差别在于组织数据的轴心变了:不以「交易撮合」为轴心,也不以「工商风险」为轴心,而以「这家工厂的真实生产能力」为轴心。


把四个阶段连起来看,中国用三十四年走完了一条与美国不同的路径:

  • 美国:信用评估 → 标识符 → 全球商业基础设施;
  • 中国:商情匹配 → 交易平台 → 工商查询 → 产业属性加工。

两条路径的终点正在靠近,但起点的差异留下了长期影响。这是下一章的主题。

二十九、为什么中国没有长出邓白氏

这是一个经常被提起的问题,通常的回答是「中国的商业信用体系不成熟」。这个回答不能说错,但过于简略。更准确的解释有四层。

第一层:需求的性质不同。

邓白氏诞生于赊销信用的需求。19 世纪的美国,商业信用是跨州贸易的基础设施,没有信用评估就无法完成交易,因此信用信息具有极高的支付意愿。

中国的商业环境长期以现款现货、预付款、票据为主,赊销的普遍程度低于同期的美国。信用评估的需求确实存在,但没有到「不评估就无法交易」的程度。相反,「找到合适的交易对象」这个需求,在中国制造业爆发式增长的年代要迫切得多。

需求的性质决定了产品的形态,也决定了谁会付钱。

第二层:公共数据的开放路径不同。

美国的企业信息长期是分散的、州级的、部分私有的,这为商业化的信息汇聚机构留下了巨大空间——邓白氏的价值有相当一部分来自「把散落各地的信息集中起来」。

中国的路径相反。2015 年三证合一、统一社会信用代码,加上国家企业信用信息公示系统的建立,使得基础的企业登记信息成为公共产品,免费可查。这在社会效率上是巨大的进步,但它也意味着「汇聚基础工商信息」这件事的商业价值被大幅压缩了——公共部门已经把它做完了。

这是一个重要的判断:在中国,产业数据的商业价值不在基础登记信息层,而在登记信息之外的产业属性层。 前者已经是公共品,后者仍然是无人区。

第三层:标识符的建立方式不同。

邓白氏编码是市场演化出来的私有标识符,因此它的所有者能够从中持续获益。统一社会信用代码是国家建立的公共标识符,不属于任何一家机构。

从社会整体效率看,公共标识符显然更优——它免费、覆盖完整、权威可靠,避免了私有标识符可能带来的锁定和寻租。但从产业形态看,它也意味着中国不会出现一家「靠标识符收租」的公司。

中国的产业数据机构必须在标识符之上的加工层建立价值,这是一个更难、但也更贴近实际应用的位置。

第四层:时间尺度不同。

邓白氏用了一百二十二年才推出编码,用了一百八十四年做到 23.8 亿美元营收。中国的企业信息服务行业从 2014 年前后才真正起步,到今天不过十余年。

用十余年去对标一百八十四年,本身就不合理。更有意义的比较是:在同样的发展阶段上,双方各自在做什么。1963 年的邓白氏刚刚推出编码,当时它的核心业务仍然是人工撰写的信用报告;而 2026 年的中国企业数据服务商,已经在提供机器可直接调用的接口和智能体能力。

在技术形态上,中国实际上是跳跃式发展的——没有经历纸质报告到电子报告的漫长过渡,直接进入了数据库加接口的阶段;也没有经历接口到智能体的缓慢演进,几乎与全球同步。


综合四层,可以得出一个不那么直觉的结论:中国没有长出邓白氏,不是因为落后,而是因为基础层被公共部门以更高的效率做掉了,商业机构被推到了更上层的加工环节。

这个位置更难做——它需要处理本文第二部分描述的全部脏活,而且没有标识符垄断带来的天然壁垒。但它也更贴近产业的实际需求:一家工厂需要的不是一个编码,而是一份能让它被正确的买家找到、被正确的供应商识别、被正确的金融机构评估的完整画像。

这正是第一公里的价值所在。

第六部分 落点与前路

三十、入表:制造业为什么排在第一

回到本文开头提到的那个数字:截至 2026 年 4 月 30 日,136 家 A 股上市公司披露了数据资源入表事项,涉及金额 37.86 亿元。

在非上市公司的统计中,有一个细节值得单独拿出来分析:截至 2026 年 3 月 31 日,417 家披露入表情况的非上市公司里,制造业增长至 32 家,成为入表数量最多的行业。

这个结果与直觉不符。数据资产化的讨论通常围绕互联网、通信、金融展开,制造业被认为是数据基础薄弱的一方。为什么在非上市公司的入表名单里,制造业排在第一?

有三个解释。

第一,制造业的数据有明确的物理对应,成本更容易归集。

会计准则要求数据资源以成本计量,而成本归集的前提是能够清晰界定「这份数据是什么、为它花了哪些钱」。

制造业的数据大多与具体的物理过程绑定:某条产线的设备运行数据、某道工序的质量检测数据、某个产品的能耗数据、某个设备的预测性维护数据。这些数据的采集有明确的硬件投入(传感器、采集器、边缘设备),有明确的系统投入(MES、数采平台),有明确的人力投入。归集起来相对清晰。

相比之下,一家互联网公司的用户行为数据,其成本弥散在整个产品研发和运营中,很难切分出「这部分开销是为了这份数据」。

前文提到的具体案例可以印证这一点:某企业围绕小区电梯物联网设备实时采集的预警数据,经过合规评估、产权登记、入表核算、价值评判等流程后,入表账面价值 53.57 万元,计入无形资产。这类数据的成本边界非常清楚——设备、采集、存储、处理,每一项都能对应到具体的支出。

第二,制造业有明确的地方政策驱动。

2025 年以来,许多地区出台了数据资产入表财政补贴相关政策,部分地区还发布了数据资产入表指引或指南;湖南省、山东青岛等地明确了阶段性的数据资产入表目标。制造业企业是地方经济的主体,也是地方政策最容易触达的对象。

这个因素需要辩证看待。政策驱动能加速起步,但也带来「为入表而入表」的风险——如果企业的动机是获得补贴或者完成指标,而不是真的要把数据用起来,那么入表就变成了一次性的账务操作,没有后续。

第三,制造业有真实的融资诉求。

数据资产入表的一个直接用途是增信。已入表企业累计获得的融资(包括银行授信、作价入股等形式)达到 20.92 亿元;2026 年 5 月,中国银行温州市分行推出「数据产权贷」,依托数据产权登记证书、数据知识产权、数据资产登记凭证、数据合规评审证书的四证增信体系,授信总额 5 亿元。

对于轻资产、缺抵押物的中小制造企业来说,数据资产提供了一条新的增信路径。这个诉求是真实的,不是政策制造出来的。


不过,入表数据的整体规模仍然很小——79 家上市公司的入表金额在 500 万元以下,占比 61%;多数企业的入表金额在 500 万元以下。这说明当前阶段的入表,象征意义大于财务意义。

从第一公里的角度看,入表真正的价值不在报表上的那个数字,而在于入表这件事本身,倒逼企业把数据治理做了一遍。

要完成入表,企业必须依次回答:

  • 这份数据是什么?边界在哪里?(数据资源目录)
  • 它的权属清楚吗?(合规评估与产权登记)
  • 为它花了多少钱?哪些支出可以资本化?(成本归集)
  • 它未来能带来什么经济利益?(价值论证)
  • 它的质量如何?如何持续维护?(数据治理)

这五个问题,恰好是本文第三部分讨论的加工方法论在企业内部的映射。一家企业哪怕最终只入表了 50 万元,只要它认真走完这五步,它对自己数据资产的认知就会发生根本变化。

入表的真正意义,是让「数据加工是有成本的」这件事,第一次在会计意义上被承认。 在此之前,数据加工的投入被记为费用,在报表上与办公用品和差旅费混在一起,无法被单独看见。

一件事只有被看见,才可能被投资。

三十一、合流:「人工智能+制造」把数据推到了台前

2025 年之后,数据要素与人工智能这两条政策线开始合流,而合流的交汇点恰好落在制造业。

时间线是这样的:

  • 2025 年 8 月,国务院印发《关于深入实施「人工智能+」行动的意见》,明确提出 2027 年、2030 年、2035 年三个阶段性目标,其中到 2027 年新一代智能终端、智能体等应用普及率超过 70%,2030 年超过 90%。
  • 「十五五」规划纲要明确提出全面实施「人工智能+」行动,全方位赋能千行百业。
  • 2026 年 1 月 7 日,工业和信息化部、中央网信办、国家发展改革委、教育部、商务部、国务院国资委、市场监管总局、国家数据局等八部门联合印发《「人工智能+制造」专项行动实施意见》,提出到 2027 年推动 3 至 5 个通用大模型在制造业深度应用,推出 1000 个高水平工业智能体,打造 100 个工业领域高质量数据集,推广 500 个典型应用场景。

把「1000 个工业智能体」和「100 个工业领域高质量数据集」这两个目标并列写在同一份文件里,是一个重要的信号。它意味着政策制定者已经认识到:智能体的能力上限由数据供给决定,两者必须同步建设。

这个认识在工程上是完全正确的。如第 24 章所述,一个接不上真实数据的模型,无论参数量多大,在具体的产业问题上都只能给出泛泛而谈的答案,或者更糟——给出流畅但错误的答案。

那么,工业智能体需要什么数据?

答案分两层,而这两层的建设进度差别很大。

第一层是企业内部的生产运行数据。

设备状态、工艺参数、质量检测、能耗、排产、库存。这一层数据的基础设施是工业互联网,中国在这方面已经建设了将近十年:具有一定影响力的工业互联网平台超过 360 家,重点平台工业设备连接数超过 1 亿台(套),服务企业近 400 万家次,融合应用实现 41 个工业大类全覆盖;建成 5G 行业虚拟专网超过 6.4 万个、5G 工厂 1260 家;工信部会同财政部支持了 101 个中小企业数字化转型试点城市,推动 4.5 万家中小企业开展数字化转型。

这一层的基础相对扎实。

第二层是企业外部的产业主体数据。

我的上游有哪些可选供应商?某个零部件在全国有多少家能做?这家新供应商是不是真有产能?我的二级供应商集中在哪里、有没有断供风险?某个细分品类的产能分布在哪几个产业带?

这一层数据不在任何一家企业的内部系统里,也不在工业互联网平台上——工业互联网连接的是设备,不是市场。它必须由外部的数据加工方提供。

而这一层,正是本文讨论的第一公里,其建设进度明显落后于第一层。


两层数据的不对称,会带来一个具体的后果:工业智能体在「优化内部」这件事上会做得很好,在「连接外部」这件事上会长期受限。

预测性维护、工艺参数优化、质量缺陷检测、排产调度——这些都是内部问题,数据齐备,智能体可以做得相当出色。

而供应商发现、断供风险预警、产能替代方案、新市场客户开发——这些都是外部问题,需要产业主体层的数据。一个接不到这层数据的智能体,只能给出「建议寻找备选供应商」这样的空话。

从这个角度看,「1000 个高水平工业智能体」这个目标能否达成,很大程度上取决于第二层数据的供给能否跟上。而第二层数据的供给,取决于有没有机构愿意做第一公里那些不体面的脏活,以及做了之后能不能收回成本。

这就把问题推回到了经济学。

三十二、三个落点:数据要素在制造业的具体位置

抽象讨论到此为止。本章给出三个具体场景,说明产业主体数据在制造业中究竟落在哪里、缺口是什么。

落点一:向工厂销售的获客环节。

一家做工业润滑油的企业,年营收 2 亿元,销售团队 40 人,目标客户是有金属加工设备的工厂。它的获客方式通常包括:参加行业展会、投放搜索广告、老客户转介绍、销售人员自行开发。

把这几种方式的成本折算到「获得一个有效商机」的单位上,展会的投入产出比波动极大,取决于展会质量和跟进能力;搜索广告受关键词竞价影响,工业品类的单次点击成本近年持续上升;自行开发的主要成本是销售人员的时间——一个销售员如果每天花三小时筛选和拨打陌生电话,其中大部分时间消耗在「这家到底是不是我的目标客户」上。

这个场景需要的数据非常具体:

  • 有金属加工设备(可通过招聘岗位、设备采购记录、工艺类专利推断);
  • 规模在特定区间(社保人数分档);
  • 地理位置在销售人员可覆盖范围内(生产地址坐标);
  • 有可直接联系的采购或生产负责人(决策人联系方式)。

四个条件同时满足的名单,就是这家企业的销售效率杠杆。目前市场上能提供的,通常只能满足前两个条件,第三和第四个条件的供给缺口最大。

落点二:供应链寻源与合规审查。

一家家电品牌需要为某个塑料结构件寻找第二供应商。它的需求包括:找出全国范围内具备相应注塑吨位和精度的工厂、排除有重大司法风险的、确认产能规模能承接订单、评估地理位置对物流成本的影响、核实是否具备必要的认证。

这个场景的数据需求比落点一更严格,因为决策后果更重——选错供应商的代价是产线停摆。

这里有一个容易被忽略的需求:二级供应商的穿透。品牌方知道自己的一级供应商是谁,但往往不知道一级供应商的关键原材料来自哪里。当某个上游环节出现供应中断时,冲击会沿着链条传导,而品牌方缺乏提前识别的能力。

要做穿透,需要的正是产业主体层的数据——某个细分材料在全国有哪些生产企业、产能分布在哪几个区域、有没有单点依赖。这类分析目前主要依靠人工调研完成,成本高、周期长、更新慢。

落点三:产业金融与区域招商。

县域银行要给辖区内的制造企业做授信,需要判断的是:这家企业是不是真在生产、订单是否稳定、上下游关系是否可靠。传统的判断依据是财务报表和抵押物,而中小制造企业的报表质量往往有限。

产业主体数据在这里提供的是经营活性的旁证:持续的招聘记录、稳定的社保人数、连续的中标记录、正常的用电用能、活跃的对外交易。这些信号无法替代财务分析,但可以作为交叉验证,尤其是在识别「壳企业」和「僵尸企业」上效果明显。

区域招商的需求类似但方向相反。一个开发区要引进某个产业链上的配套企业,需要知道:这个链条上的关键环节有哪些、全国有哪些企业在做、它们分布在哪里、哪些具备外迁或扩产的可能性。这本质上是一个基于产业主体数据的图谱分析问题。


三个落点的共同特征是:它们需要的都不是某一家企业的深度信息,而是某一类企业的完整名单加基本属性。

这与传统企业征信的产品形态正好相反。征信产品是「深」的——针对一家企业提供尽可能详尽的信用画像;产业数据产品是「广」的——针对一个条件提供尽可能完整的候选集合。

深与广对数据加工提出的要求完全不同。深需要的是单点的准确与详尽,广需要的是全量的覆盖与一致的口径。一家做惯了「深」的机构,转做「广」并不容易——它的采集方式、质量标准、成本结构都要重建。

这也是为什么产业数据这个品类没有被现有的企业信息服务商自然覆盖:不是不想做,而是它需要的是另一套东西。

三十三、跨境:中国制造需要一层可被境外核验的数据

第一公里还有一个方向上的延伸,值得单列一章:中国工厂的数据如何被境外买家使用。

先看规模。2025 年我国有进出口记录的经营主体超过 78 万家,其中民营企业进出口 26.04 万亿元,增长 7.1%,占进出口总值的比重提升至 57.3%。在我国专精特新「小巨人」企业的外贸总值中,民营企业占比超过七成。

这意味着中国制造出海的主力,是数量庞大、单体规模不大的民营企业。而恰恰是这类企业,在国际市场上面临最严重的信息不对称。

境外买家的困难是具体的。

一个德国的采购经理要在中国找一家能做特定精密件的供应商,他面对的问题包括:如何知道候选企业是真工厂还是贸易商;如何核实对方声称的认证是否有效;如何判断对方的产能是否匹配自己的订单量;如何了解对方是否有司法风险或者环保处罚记录;如何在不实地考察的情况下降低试单风险。

传统的解决方案是三种:参加展会当面接触、委托第三方验厂机构、依赖长期合作的贸易代理。三种方案的共同点是成本高、覆盖窄——展会一年几次,验厂一家几千到几万元,代理只推荐自己熟悉的工厂。

而买方的合规要求在同时提高。

欧盟《企业可持续发展尽职调查指令》(Directive (EU) 2024/1760,通称 CSDDD)于 2024 年 7 月 25 日生效,要求适用企业识别、预防、减轻并补救其自身运营、子公司以及整个「活动链」中的人权与环境风险。这项指令后续通过综合法案(Omnibus)进行了大幅修订,适用门槛提高、评估频率从至少每 12 个月一次放宽到每 5 年一次,对中国企业的直接适用范围也相应收窄——只有在欧盟拥有超大型运营规模的中国企业才被直接纳入。

但直接适用范围之外,还有链式传导。绝大多数中国供应商即便不在直接适用范围内,也会因为其欧盟客户需要履行尽职调查义务,而被要求提供相应的信息与承诺。合规义务顺着采购合同一级一级传下去,最终落在具体的工厂身上。

对中国工厂而言,这带来一个新的要求:它需要一个可以被境外买家核验的数据身份——不是自己填的问卷,而是可以从独立来源交叉验证的记录。

这正是邓白氏编码在国际贸易中的作用之一:多个国际组织和欧盟、美国、日本、中东等国家和地区的政府机构,把邓白氏编码作为企业注册或者通关时必须提供的信息,用于快速查询和了解企业基本情况。

中国有统一社会信用代码,它在国内的权威性和覆盖率都很高,但它在境外的可识别性和可解释性有限——一个境外采购经理拿到一串 18 位代码,没有便捷的渠道把它翻译成自己能理解的企业画像。

这里存在一个明确的、尚未被填补的空白。

再看数据出境的合规框架。

2024 年 3 月,国家网信办出台《促进和规范数据跨境流动规定》,对数据出境安全评估、个人信息出境标准合同、个人信息保护认证等制度作了优化调整。核心变化是放宽条件、收窄安全评估范围:明确了免予申报安全评估的情形,规定未被相关部门、地区告知或者公开发布为重要数据的,数据处理者不需要作为重要数据申报安全评估;同时设立了自由贸易试验区负面清单制度。此后,安全评估申报指南更新到第三版,并新增多个省级网信办作为预评估试点。

把这套框架应用到工厂数据上,可以得到一个相对清晰的判断:

  • 不包含个人信息、也未被认定为重要数据的企业公开信息,出境的合规负担较轻;
  • 包含个人信息的部分(如联系人姓名与联系方式),需要走标准合同、认证或安全评估之一,且要遵循最小必要原则;
  • 涉及产业整体产能分布、供应链结构的汇总性数据,需要判断是否落入重要数据范畴,这一判断应当以主管部门的告知或公开发布为准。

从产品设计的角度,一个可行的思路是分层:基础的工厂身份与能力信息面向境外可用,涉及个人信息的部分单独处理并履行相应程序,宏观汇总层面的数据审慎对待。


把三条线索合起来看,「国际数据合作」在制造业上的具体落点其实相当清楚:不是宏大的跨境数据流通协议,而是一件很具体的事——让中国的几百万家工厂,拥有一份境外买家看得懂、能核验、可持续更新的数据画像。

这件事的商业价值和产业价值都是明确的。它同时服务于中国制造的出口竞争力和境外采购方的供应链安全。而它的前提,依然是第一公里那套脏活做得足够扎实。

三十四、第一公里的经济学:谁该为加工买单

全文讨论到这里,可以收束到一个核心问题:数据加工这项投入,靠什么收回成本?

先把加工的经济特征说清楚。

特征一:它是前置投入。

要提供一份可用的工厂数据产品,必须先完成采集、清洗、对齐、判定、标注、核验的全过程。这个过程在第一个客户付费之前就要完成,而且不能只做一部分——一份只覆盖三个省的工厂数据,对全国性的客户几乎没有价值。

特征二:它是重资产,但资产不可见。

投入的形态是人力、算力、时间。产出的形态是数据库里的记录。这些记录在会计上很难被确认为资产(如第 30 章所述,成本计量的要求相当严格),在融资时很难作为抵押物,在估值时很难被外部准确评估。

特征三:它的回收周期长,且与调用量强相关。

按次调用的定价模式下,单次收入很低(如第 23 章引用的公开价格,量级在 0.1 元到 0.25 元之间),必须依靠足够大的调用量才能覆盖固定成本。而调用量的增长需要时间——需要客户接入、需要场景成熟、需要生态形成。

特征四,也是最关键的一条:它有很强的正外部性,而这部分外部性无法被加工者捕获。

当一份高质量的工厂数据存在时,社会整体会节省大量重复成本:每一家需要找工厂的企业不必自己去建数据库,每一家银行不必重复做尽调,每一个研究机构不必重新采集样本。这部分节省的社会成本,远大于数据加工者能够收取的费用总和。

正外部性无法被捕获,意味着市场会系统性地投入不足——这是公共经济学里的经典结论。


那么,谁来买单?现实中存在四种路径,各有利弊。

路径一:下游用户按使用分摊。

这是最市场化的路径,也是本文第 22、23 章讨论的按次调用模式。优点是激励相容——用得多的付得多,加工者有动力持续提升质量。缺点是启动困难:加工者必须先垫付全部前期投入,且在调用量起来之前无法证明模式可行。

路径二:公共财政直接投入。

高质量数据集和数据标注产业走的是这条路。国家层面布局了「7+32」数据标注先行先试格局,7 个国家级数据标注基地已建成高质量数据集 524 个、服务 163 个大模型、带动相关产值超过 83 亿元;多地对数据资产入表提供财政补贴。

优点是能快速跨过启动门槛,缺点是可能偏离真实需求——为完成指标而建的数据集,未必是市场真正需要的数据集。

路径三:公共数据授权运营的准许收益模式。

如第 4 章所述,这条路径给运营机构一个受管制的回报率:准许收入等于经营成本加准许利润,利润率按 10 年期国债平均收益率加不超过 6 个百分点确定。

这个模式的精妙之处在于,它承认加工是有成本的,同时限制加工者的定价权,避免公共资源被过度定价。目前它只适用于公共数据。

一个值得讨论的问题是:这个思路能否部分外推到具有基础设施属性的社会数据加工上? 比如,对于那些明确具有公共品性质的产业数据(如全国性的产业主体名录),是否可以探索类似的「准许成本加合理收益」安排,以换取其在特定用途下的低价开放?这个问题目前没有答案,但值得提出。

路径四:交叉补贴。

数据加工者用其他业务的利润补贴数据建设,把数据能力作为主营业务的基础设施而非独立利润中心。互联网平台常用这个模式。

优点是可以承受更长的投入周期,缺点是数据业务会服从于主业的战略需要,独立性和中立性受影响。


四条路径中,目前中国的实际情况是路径一和路径四为主,路径二在高质量数据集领域快速推进,路径三仅限于公共数据。

而第一公里最需要支持的那部分——面向全社会的、通用的、基础性的产业主体数据加工——恰好落在四条路径的缝隙里:它不属于公共数据(数据源是社会公开信息),不容易被财政直接投入(它不是一个可以验收的项目),也不容易靠单一客户的付费覆盖成本(正外部性太强)。

这就是本文标题所说的「第一公里」在制度层面的真实处境:它在所有文件里都被默认已经完成了,但实际上没有人被明确指定去完成它。


需要说明的是,本文无意主张这项工作应当由财政承担。市场化的加工者有其不可替代的优势——它们贴近真实需求,迭代速度快,对质量的敏感度高,因为质量直接决定收入。

本文想指出的是另一件事:当我们评估数据要素市场的进展时,不应该只看交易额、入表金额、交易所数量这些流通侧和资产侧的指标,还应该关注加工侧的投入是否足够。

一个可能的观察指标是:有多少机构在持续投入建设通用的产业数据底座,它们的投入规模有多大,能否持续。如果这个指标长期低迷,那么无论流通侧的制度多么完善,市场也不会真正活跃——因为货架上没有足够好的商品。

三十五、九个常见误判

本文讨论的方法论,其反面是一组具体的、反复出现的错误。把它们集中列出来,比正面陈述原则更有实用价值。

以下九条,全部来自本文前面各章的讨论,在产业数据的研究和产品实践中都属于高频错误。

误判一:把登记行业当作生产事实。

表现:用「行业门类为 C 制造业」直接等同于「这是一家工厂」,或者用规模以上工业企业数量代表制造业主体总数。

后果:名单中混入大量不生产的主体,同时遗漏大量登记在其他门类的实际生产者。

正确做法:登记信息用于确定主体范围,生产事实用多源硬信号交叉判定(第 10 章)。

误判二:把经营范围当作能力清单。

表现:按经营范围包含某个关键词来筛选供应商。

后果:经营范围是高召回低精度的字段,筛出的名单里绝大部分企业并不实际从事该业务。

正确做法:把经营范围当作候选池的圈定工具,而不是确认工具(第 9 章)。

误判三:用单一来源下结论。

表现:只用招投标数据评估行业格局,只用官网信息判断产品线,只用海关数据统计外贸企业。

后果:结论会沿着该来源的系统性偏差方向失真,而且失真的方向是可预测的——用招投标数据会高估体制内供应链,用官网数据会得到比现实光鲜的画面。

正确做法:结论至少由两个偏差方向不同的来源共同支撑(第 16 章)。

误判四:名称匹配不带地域约束。

表现:用字号加行业词直接匹配合并记录。

后果:中文企业字号重名率极高,无地域约束的匹配会制造大量错误合并,把不同企业的信息混到一起。

正确做法:地域信息冲突时,即便字号完全相同也不合并;宁可漏合并,不可错合并(第 17 章)。

误判五:用精确数字表达不精确的判断。

表现:报出「共 12,847 家符合条件」这样精确到个位的总数,而筛选条件中包含需要语义判断的维度。

后果:读者会按数字的精度水平建立信任,而实际误差可能达到 20% 以上。一旦被发现,损害的是整个数据源的可信度。

正确做法:对判定类结果给出区间或明确标注口径,把「按当前判定规则命中的记录数」与「真实存在的数量」区分表述(第 20 章)。

误判六:用总体准确率掩盖字段差异。

表现:宣称「数据准确率 98%」。

后果:不同字段的准确率差异可能达到几十个百分点。一个总体数字会让用户对最弱的那个字段产生错误预期,而用户恰恰最可能在最弱的字段上受损。

正确做法:分字段披露准确率,并说明核验方法(第 20 章)。

误判七:把矛盾消除而不是记录。

表现:两个来源冲突时,按预设的优先级取其一,丢弃另一条。

后果:丢失的往往是最有价值的信息。「工商状态存续,但社保为零、无招聘、无中标、官网失效」这个矛盾组合,本身就是一个高价值判断。

正确做法:保留矛盾,并把矛盾作为独立信号使用(第 18 章)。

误判八:覆盖更新可变字段,不保留历史。

表现:每次采集直接覆盖旧值。

后果:系统只能回答「现在是什么」,无法回答「什么时候变的」。而在产业分析中,变化的信息量往往大于状态。等到需要趋势分析时,历史已经永久丢失。

正确做法:对关键可变字段建立快照或时序记录,从第一天开始(第 15 章)。

误判九:让模型补全缺失字段。

表现:某个字段为空时,用大模型根据上下文推测一个合理值填进去。

后果:产生无法被用户识别的错误。填充值看起来与真实数据完全一样,用户无从分辨。数据产品的可信度不是降到 80%,而是降到零——因为用户不知道哪 80% 可信。

正确做法:模型用于抽取和理解,不用于生成事实;每一个字段值都必须能回溯到原始文本的具体出处(第 19 章)。


九条误判有一个共同的结构:它们都是用一个便宜的替代品,去代替一件昂贵的事情。

用登记行业代替生产判定,省下了多源交叉的成本;用单一来源下结论,省下了多方核实的成本;用模型补全字段,省下了采集的成本;用精确数字表达模糊判断,省下了解释口径的麻烦。

每一次替代都能节省成本,而且短期内不会暴露问题——因为数据产品的错误通常是静默的,用户要在实际使用中受挫之后才会发现。

这构成了产业数据行业的一个长期风险:低质量的供给在短期内具有成本优势,而质量的差距需要很长时间才会被市场识别。 这也是为什么这个行业需要口径披露、方法说明和可追溯性——它们是让质量差异变得可见的机制。

三十六、三个判断与三个不确定

在结语之前,把本文的核心判断和尚未解决的问题分开陈述。

判断一:数据要素市场当前的瓶颈在加工侧,不在流通侧。

支撑这个判断的证据贯穿全文:制度体系已经在四年内基本封顶;数据生产总量以每年超过 25% 的速度增长;但结构化存储只占生产总量的约 1%,A 股 5000 多家上市公司账面确认的数据资产合计 37.86 亿元,场内交易仅占数据流通市场的 5% 左右。

屋顶、产量、通道都不缺,缺的是能进入通道的商品。而商品的短缺,源于把原始数据变成商品的那道工序投入不足。

判断二:接口调用将成为数据产品的主要交付形态。

驱动力有三个:三权分置的制度设计天然适配「数据不转移、只交付使用」的形态;按次调用解决了数据定价中最难的计量问题;调用方从人变成模型之后,界面形态的价值下降而接口形态的价值上升。

官方定价文件已经把「数据调用量」列为合法的收费形式,市场上也已经出现了面向智能体的具体产品。这个方向的转变在未来几年会加速。

判断三:产业数据的长期竞争是运营能力的竞争,不是采集能力的竞争。

一次性把几百万家企业的信息采集完整,是一个可以在有限时间内完成的工程项目。此后每年让这些记录保持有效,是一项永不结束、成本随存量递增的运营任务。

邓白氏一百八十多年的历史提供了同样的证据——它对外强调的核心能力不是数据规模,而是持续运行的质量核验流程。


以下三个问题,本文没有答案。

不确定一:加工环节的制度激励会不会出现?

如第 34 章所述,通用产业数据加工落在现有四条买单路径的缝隙里。它可能通过市场自发解决——只要调用量增长得足够快,按次分摊的模式就能跑通;也可能长期投入不足,导致数据要素市场始终缺少高质量的基础供给。

这取决于两件事的赛跑:调用需求的增长速度,与加工者的现金流耐受度。

不确定二:模型能力的提升,会削弱还是增强数据加工的价值?

这是一个真正开放的问题,而且存在两种相反的可能。

一种可能是削弱:当模型具备足够强的实时检索和信息整合能力时,它可以在需要的时候自己去公开渠道抓取和判断,不再依赖预先加工好的数据库。加工的价值被模型的能力吸收。

另一种可能是增强:模型的实时检索受限于访问权限、速度、成本和一致性——它无法在一次对话中扫描几百万个网页,也无法保证两次询问得到一致的答案。而且如第 24 章所述,错误数据经过模型会被放大而非稀释,这反而抬高了对数据源质量的要求。

从目前的技术现实看,第二种可能性更大:模型擅长处理已经被组织好的信息,不擅长从零开始组织信息。但这个判断的把握度不高,未来两三年可能出现变化。本文选择把它列为不确定,而不是伪装成判断。

不确定三:产业数据的口径会不会走向统一?

本文第 21 章反复强调口径。但现实是,每一家机构都在用自己的口径,彼此不可比。

理论上存在两条统一路径:一是由标准化机构制定国家或行业标准;二是由市场竞争产生事实标准,像邓白氏编码那样。

第一条路径的困难在于,产业属性的判定标准与用途强相关,很难有一套标准满足所有用途。第二条路径的困难在于,中国的基础标识符已经是公共品,商业机构在加工层建立事实标准的难度更大。

如果口径长期不统一,产业数据的可比性、可流通性、可交易性都会受限——因为交易的前提是双方对交易标的的定义一致。这可能是这个行业未来最大的结构性障碍。

三十七、产业带:一层没有被官方收录的组织单位

在讨论前路时,有一层组织单位值得被单独提出来,因为它在中国制造业中的重要性,与它在数据体系中的地位严重不匹配。

这层单位叫产业带。

中国制造业的空间分布高度集聚,集聚的尺度之细在全球范围内相当罕见。浙江诸暨大唐的袜业、广东中山古镇的灯饰、河北安平的丝网、浙江柯桥的纺织、福建晋江的鞋服、广东虎门的服装、浙江永康的五金、江西南康的家具——这些名字在各自的行业里,指的不是一个地名,而是一个产能高度集中的完整配套体系。

一个镇,有时候甚至一个村,集中了某个细分品类在全国相当比例的产能,同时聚集了配套的原料供应、模具加工、表面处理、物流货代、专业市场。对于寻源方来说,找到产业带就等于找到了一整个候选池;对于研究者来说,产业带是观察产业转移和集群升级最合适的尺度。

但是,产业带在中国的任何一套官方数据体系里都不存在。

原因是它落在两套体系的交叉点上,而两套体系都不覆盖对方的维度:

  • 行政区划体系有空间属性,没有产业属性。它能告诉你诸暨市大唐街道在哪里,不能告诉你那里在做什么。
  • 国民经济行业分类有产业属性,没有空间属性。它能告诉你袜业属于哪个小类,不能告诉你这个小类的产能集中在哪几个镇。

两套体系各自完整,但它们的交叉——「某个空间单元上的某个产业集聚」——不属于任何一方的登记范围。统计部门做地区分行业统计,最细通常到地级市或县;行业协会掌握本行业的集群分布,但缺少跨行业的统一口径。

于是,一个在产业实践中人人都知道、天天都在用的概念,在数据世界里是空白的。

要把产业带识别出来,只能靠加工。

方法上,产业带识别是一个空间与语义的联合聚类问题:把工厂的地理坐标与产品类目放在一起,寻找「在小尺度空间内、同一品类密度显著高于周边」的区域。天下工厂产业平台在其工厂库上标注的产业带数量为 1000 个以上。

这项工作有三个技术难点:

第一,边界不与行政边界重合。 一个产业带经常跨越两三个乡镇,甚至跨越县界。如果按行政单元统计,同一个产业带会被切成几块,每一块看起来都不显著。识别必须从地理位置本身出发,而不是从行政区划出发。

第二,品类粒度必须选对。 粒度太粗,所有制造业大县看起来都一样;粒度太细,同一个产业带内部的上下游会被拆成互不相干的几个集群。合适的粒度往往需要按行业单独调校。

第三,产业带在移动。 过去二十年,中国制造业经历了从沿海向内陆、从大城市向县域的持续转移。一个产业带可能在衰退,另一个在形成。静态的产业带名录会迅速过时,需要持续更新。

从数据要素的角度看,产业带这一层的价值在于它是一个天然的「数据产品单元」。

一份「某个产业带的完整工厂名录加配套结构」,对采购方、招商方、研究机构、金融机构都有明确价值,用途具体、边界清晰、可以定价——恰好符合本文第 5 章总结的「用途具体则加工价值可被支付」的规律。

相比之下,「全国某行业企业名录」这样的产品,虽然规模更大,反而更难卖出价钱,因为它对任何一个具体买家都不精准。

这提示了产业数据产品化的一个方向:不是把数据做得更大,而是把它切得更准。

三十八、没有历史的截面

最后一个结构性问题:中国的产业数据,几乎全部是当前截面。

这句话的意思是:你可以查到一家工厂今天的注册资本、社保人数、经营状态、产品线;但你几乎无法查到它三年前的这些信息,更不用说十年前。

原因有三层。

第一层,早期没有人保存。 大规模的企业数据采集在中国普遍始于 2014 年之后,此前的信息大多只以纸质或分散的电子形态存在,没有被系统化地结构化保存。

第二层,采集方普遍采用覆盖更新。 如第 15 章所述,把可变字段直接覆盖是最省事的做法,代价是历史被永久抹掉。等到意识到历史有价值时,已经无法追补——数据源不会提供过去的快照。

第三层,部分数据源本身不保留历史。 招聘信息在职位关闭后下架,官网改版后旧版本消失,展会名录逐年更新不留存档。这些信息在产生的时候是公开的,但公开的窗口期很短。

后果是,主体级的纵向研究在中国几乎无法开展。

举几个具体的、有价值但目前做不了的研究:

  • 过去五年,某个细分品类的产能从哪些区域迁到了哪些区域?迁移的规模有多大?
  • 一家工厂从成立到成为「专精特新」,其用工规模、专利申请、客户结构的变化轨迹是什么样的?
  • 某一轮环保政策或者贸易摩擦之后,受影响区域的工厂主体数量、平均规模发生了什么变化?存活下来的和退出的,事前有什么可观测的差异?
  • 产业带的生命周期有多长?一个产业带从形成、繁荣到衰退,各阶段的可观测特征是什么?

这些问题目前只能用统计年鉴的宏观数据做粗略回答。宏观数据能告诉你某个行业某个省的总量变化,无法告诉你这个变化是由哪些主体的进入和退出构成的——而后者才是理解产业演化的关键。

这个缺口的特殊性在于,它无法用投入换取,只能用时间换取。

绝大多数数据问题都可以通过增加投入来解决:覆盖不够就扩大采集,准确率不够就增加核验,粒度不够就细化分类。唯独历史不行。今天没有保存的截面,明天花再多钱也买不回来。

这带来两个推论。

推论一,对数据加工者而言,时序积累是唯一具有真正时间壁垒的资产。 数据规模可以被追赶,采集技术可以被复制,分类体系可以被模仿,但「从五年前开始每月保存一次的完整快照」无法被任何后来者补齐。

推论二,对入表和估值而言,这一点应当被认识到。 一份积累了多年时序记录的产业数据库,其价值不能只按重置成本计量——重置成本可以算出重新采集一次当前截面要花多少钱,但算不出重新获得五年历史要花多少钱,因为那件事在物理上不可能。

当然,如第 30 章所述,现行会计准则要求以成本计量,不允许用评估值直接入账。这个规定在防范虚增资产上是合理的。但它同时意味着,产业数据中最有价值的那部分——时间——在报表上是隐形的。

这或许是数据作为生产要素与其他生产要素最不同的一点:土地、资本、劳动力、技术都可以在需要时购置或者培养,唯有数据的时间维度,只能靠提前开始。

对于任何一个准备长期投入产业数据的机构,本文能给出的最具体的一条建议是:从今天起,把每一次采集的结果完整保存下来,哪怕现在还不知道它有什么用。

三十九、回到那个问题

现在可以回答序章提出的问题了:中国有多少家工厂?

正确的回答方式不是给出一个数字,而是先反问一句:你要用这个数字做什么?

如果你要做宏观经济分析,判断工业景气度,那么答案是规模以上工业企业约 43.6 万家(2025 年末),因为这个口径统计连续、可比、有配套的营收和利润数据。用它来分析趋势,是最可靠的。

如果你要评估制造业的主体规模、研究企业结构、测算市场容量,那么答案是制造业企业 246 万家(截至 2025 年 5 月 31 日,统一社会信用代码口径),因为它覆盖了全部登记为制造业的企业法人,不受营收门槛限制。

如果你要做产业政策,关心的是「有多少个实际在从事生产的经营单位」,那么两个数字都不够——你还需要把登记为个体工商户的加工主体、登记在其他门类但实际有生产的主体计入。这个口径下的数字更大,但没有权威统计。

如果你是一个销售人员、采购经理、或者信贷员,你真正需要的其实根本不是总数。你需要的是一份满足特定条件的名单:在你的覆盖范围内、做你关心的品类、规模匹配你的业务、并且能联系上能拍板的人。

四种用途,四个答案。 而这四个答案之间的差异,不是统计误差,是定义差异。

这就是本文用五万字讨论的那件事:产业数据的核心难题,从来不是「数据在不在」,而是「数据有没有被组织成能回答具体问题的形状」。

序章里列举的四个商业问题——工业清洗剂企业要找电镀厂客户、欧洲采购商要找医疗级注塑件供应商、银行普惠部门要甄别县域里的真实产能、工业软件公司要定位特定规模区间的离散制造企业——这四个问题至今没有一个能从统计年鉴里找到答案。

不是因为统计做得不好。统计做得很好,它准确地回答了它被设计来回答的问题。

而是因为这四个问题需要的是另一种东西:一层以「具体的一家工厂」为单位组织起来的、带产业属性的、持续更新的、可以被机器直接调用的数据。

这层数据不属于任何一个部门的职责范围。工商部门负责主体登记,统计部门负责总量核算,工信部门负责产业管理,海关负责进出口监管——每一个部门都掌握着这层数据的一部分,但没有一个部门的职责是把它们拼起来,并加工到可以直接使用的程度。

这个位置是空的。而空着的位置,最终要由市场去填。

结语:把公开变成可用

1841 年,刘易斯·塔潘在纽约雇佣通讯员,让他们写下俄亥俄州某个小镇上一家杂货店的经营状况。那些手写的报告被装订成册,供纽约的批发商查阅。

一百八十五年后,这件事的技术形态已经完全改变,但内核没有变:把只有当地人知道的事情,变成远方的人可以依靠的信息。

中国制造业的现状,某种意义上就是 19 世纪美国商业的放大版。几百万家工厂散布在一千多个产业带里,每一个产业带内部的信息是充分的——同一个镇上的人知道谁家的设备好、谁家的交期准、谁家的老板讲信用。而这些信息一旦离开那个镇,就迅速衰减到接近于零。

一个上海的采购经理、一个德国的品牌商、一个县城的信贷员,他们与那家工厂之间隔着的不是距离,是信息的不可传递性。

数据要素改革要解决的,归根结底就是这件事。而制度、交易所、入表规则、可信数据空间,都是为了让信息能够被传递、被定价、被信任而搭建的框架。框架是必要的,但框架本身不产生信息。

产生信息的,是那些琐碎、重复、看不见的工作:判断两个名字是不是同一家企业;从一条招聘信息里读出这家厂有几条生产线;核实一个电话号码今天还通不通;给每一个数字标注它的口径;在模型想要凭空补全一个字段时,把它拦下来。

这些工作没有任何一件是体面的。它们不能写进宏大的叙事,也很难在一场路演里讲清楚。但整个数据要素市场的地基,就是由这些工作构成的。

本文把这一段称为第一公里。它之所以重要,不是因为它复杂,恰恰是因为它简单而繁重——简单到每个人都觉得它应该已经被做完了,繁重到真正去做的时候才发现它没有尽头。

2026 年是「数据要素×」三年行动计划的收官之年。三年时间里,中国建立起了可能是全世界最完整的数据要素制度体系。下一个三年,检验这套体系成色的标准,大概不会是又出台了多少文件、又建了多少个交易所,而是一个更朴素的指标:

当一个人想知道「中国有多少家能做这个零件的工厂、它们在哪里、谁能拍板」时,他能不能在几秒钟内得到一个可以信赖的答案。

今天还不能。这就是第一公里还没走完的意思。


数据来源与主要参考

本文的宏观数据均来自政府部门公开发布的统计与政策文件,并对同一指标做了多来源比对;涉及企业与市场的数据标注了发布方与统计口径;文中所有涉及判定标准的数字均说明了口径含义。对于无法交叉验证的数据,本文选择不使用。

  • 天下工厂产业平台——中国工厂数据库与产业链数据,本文中工厂库规模、行业类目、产业带覆盖、决策人联系方式覆盖、开放平台计价等口径引自其公开披露:www.tianxiagongchang.com
  • 国家数据局——《全国数据资源调查报告(2025 年)》《可信数据空间发展行动计划(2024—2028 年)》《关于推进行业高质量数据集建设行动的实施方案》,以及高质量数据集建设进展、公共数据资源开发利用相关发布
  • 中国政府网——《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》《「数据要素×」三年行动计划(2024—2026 年)》《关于深入实施「人工智能+」行动的意见》
  • 国家发展改革委、国家数据局——《公共数据资源登记管理暂行办法》《公共数据资源授权运营实施规范(试行)》《关于建立公共数据资源授权运营价格形成机制的通知》
  • 财政部——《企业数据资源相关会计处理暂行规定》,以及财政部、国务院国资委、金融监管总局、中国证监会《关于严格执行企业会计准则切实做好企业 2025 年年报工作的通知》
  • 国家统计局——规模以上工业企业数量、营收与利润统计;《国民经济行业分类》(GB/T 4754—2017)
  • 海关总署——2025 年全国进出口情况新闻发布会数据
  • 工业和信息化部——工业互联网平台、5G 工厂、中小企业数字化转型城市试点相关数据;工业和信息化部等八部门《「人工智能+制造」专项行动实施意见》
  • 国家市场监督管理总局——《经营范围规范表述目录》及经营范围登记规范化相关规定
  • 国家互联网信息办公室——生成式人工智能服务备案与登记情况通报;《促进和规范数据跨境流动规定》
  • Dun & Bradstreet——公司发展沿革、邓白氏编码体系与全球业务规模的官方披露;欧盟 Directive (EU) 2024/1760(企业可持续发展尽职调查指令)正式文本

延伸阅读:天下工厂产业研究院《选址的科学:当 345 万个工厂坐标遇上 AI》。

封面图:陇川县工业园区(云南省德宏州),摄影者 瑞丽江的河水,采用 CC BY-SA 4.0 许可,来自 Wikimedia Commons。