序章:一张 1931 年的表格

1931 年 12 月,南京国民政府实业部公布《工厂登记规则》。

这份规则本身不长,但它附带的「工厂登记附表」值得今天的人认真看一眼。附表要求登记的事项多达二十五项,并且规定工厂必须每年填报一次「厂务报告」。

二十五项。年度报告。

九十五年之后,本系列的第一篇文章讨论了当代产业数据的八个基本字段——名字、身份、分类、规模、产能、人、位置、时间——并且指出这八格至今没有一个完整可靠的公开来源。而 1931 年的那份附表,要求的项目数量是今天那八格的三倍。

这不是说民国的工厂信息比今天更完整。恰恰相反:《工厂登记规则》颁布两年后的 1933 年,据汉口社会局的调查,当地符合《工厂法》定义的工厂只「恢复到三四百户」。一个九省通衢的工业重镇,登记在册的合格工厂只有三位数。规则要求登记二十五项,而能被登记的对象本身就寥寥无几。

但这份表格提出了一个从那时起就没有变过的问题:

一个国家想要知道自己有多少家工厂、它们在哪里、造什么、有多大,应该怎么知道?

这个问题在 1931 年被提出,在 1950 年、1985 年、1995 年、2004 年、2023 年被一次次重新提出,每一次的答案都不一样,每一次都比上一次更接近,但没有一次真正完成。

本文是这个问题的一百二十年编年史。


需要先说清楚这一百二十年的分期依据。

本文不按政治史分期,也不按经济史分期,而按工厂信息的组织方式分期。判断依据只有一个:在那个年代,一个想要找到某类工厂的人,实际上是怎么找到的。

按这个标准,一百二十年可以分成六段:

  • 认脸的时代(1902—1937):靠人。商会、行会、同乡会构成信息网络,一家工厂的存在由认识它的人来证明。政府开始尝试登记,但登记覆盖不了大多数。
  • 目录的时代(1949—1978):靠计划。供需不通过寻找完成,而通过分配完成。工厂信息集中在主管部门的产品目录与订货会名册里,不面向社会开放,也不需要开放。
  • 名录的时代(1978—1998):靠纸。普查、年鉴、黄页、展会名录。信息第一次大规模地被印刷出来向社会流通,同时也第一次撞上纸张的物理极限。
  • 平台的时代(1999—2013):靠会员。B2B 平台把信息搬上网,但收录的只是愿意付费入驻的那一部分企业,信息的完整性让位于商业模式。
  • 公示的时代(2014—2022):靠公共品。三证合一、统一社会信用代码、国家企业信用信息公示系统,基础登记信息第一次成为免费可查的公共设施。
  • 接口的时代(2023— ):靠调用。信息的消费者从人变成机器,问题从「能不能查到」变成「能不能被程序直接使用」。

每一段的转折,都不是因为技术先进了,而是因为上一段的组织方式撞到了自己的边界。

认脸撞到的边界是范围——你只认识你认识的人。目录撞到的边界是需求——计划分配无法回应个性化需求。纸撞到的边界是体积与时效。会员制撞到的边界是覆盖率。公示撞到的边界是维度——工商登记不携带产业属性。

而接口时代正在撞的边界是什么,本文结尾会回答。


还要说明一件事:为什么值得写这样一部编年史。

产业数据在今天被讨论时,往往被当作一个技术问题或者一个新兴的商业机会。而实际上,它是一个已经被反复求解了一百二十年的老问题。

每一代人都以为自己手里的工具是全新的:南京国民政府以为登记规则可以解决,计划部门以为产品目录可以解决,黄页出版商以为印刷可以解决,B2B 平台以为互联网可以解决,查询工具以为工商数据开放可以解决,今天的从业者以为大模型可以解决。

每一次都解决了一部分,每一次都留下了一部分。留下的那部分,构成了下一代人面对的问题。

读完这一百二十年,会得到一个不那么令人愉快、但相当可靠的结论:工厂信息的组织,从来不是一次可以被「完成」的工程,而是一项必须被持续支付的运营。 任何一代人只要停止投入,上一代人积累的信息就会在几年之内失效。

这一点在 1937 年被证明过一次,在 1990 年代被证明过一次,今天正在被第三次证明。

第一部 认脸的时代(1902—1937)

一、1902:两家商会

1902 年,中国出现了最早的两家近代商会。

一家是上海商业会议公所,由上海通商银行总董严信厚组织成立;另一家是南通州商务总会,由张謇组建。两家的成立时间相隔不远,性质也相似——它们都不是政府机构,而是商人自己组织起来的联合体。

在此之前,中国的工商信息组织依靠的是另外三种形态:行会、公所、会馆。

行会按行业组织,管的是同业的价格、学徒、质量标准;公所按行业或地域组织,通常有实体的房产和公共基金;会馆按籍贯组织,为同乡商人提供住宿、议事、仲裁的场所。

这三种组织的共同点是:它们本质上都是熟人网络的制度化。

一个苏州的丝绸商想在汉口找一家可靠的染坊,他不查名录,他去会馆找同乡打听。同乡认识某个染坊的老板,或者认识认识那个老板的人。信息通过人际链条传递,可靠性由担保关系保证——介绍人要为被介绍人的信誉负一部分责任。

这套机制的效率并不低。在信息传输成本极高的年代,熟人网络是最经济的解决方案:它不需要维护数据库,不需要更新,信息自动随着人的流动而更新,而且天然包含了信用评价——「这家人不地道」这种判断,是任何登记表格都记录不下来的。

它的问题只有一个:范围。

熟人网络的半径受限于人的活动半径。你能找到的工厂,是你的关系链能触及的工厂。一个从未去过温州的上海商人,不可能知道温州有哪些做纽扣的作坊,无论那些作坊做得多好。

这就是本系列第一篇文章反复提到的那个问题的最早形态:信息在本地是充分的,一旦离开本地就迅速衰减到接近于零。

一百二十四年之后,这个问题在形态上完全没有变。变的只是我们为解决它所付出的工具。

二、1904:二十六条

1903 年,清政府设立商部,作为统辖农工商实业的最高管理机构。

1904 年 1 月,商部奏准朝廷颁布《商会简明章程》,共二十六条,内容包括商会的宗旨、设立办法、组织形式等,并规定:凡属商务繁富之区,宜设商务总会;于商务稍次之地设立分会,分会依其省份隶属商务总会。

同期颁布的还有《商会章程附则六条》。此后,商会才终于获得合法的社会地位,并很快在全国各地普及开来。1904 年 5 月,上海商业会议公所依据章程正式改组为上海商务总会。

《商会简明章程》在中国工商信息史上的意义,通常被低估了。它做的事情是:把原本自发的、地域性的、身份性的商人组织,变成了一套有层级、有隶属关系、有统一章程的全国性网络。

这套网络第一次让「全国范围内的工商信息」在制度上成为可能。总会与分会之间有隶属关系,意味着信息可以逐级上报、汇总;统一章程意味着各地的组织形式与记录方式趋于一致,汇总起来的信息具备了初步的可比性。

用今天的话说,商会体系提供了产业信息的第一套标准化组织架构。

当然它的实际效果受到许多限制。章程规定商会「凡所论断,一以商情利弊为宗旨,不得涉及商界以外之事」,边界划得很紧;各地商情不同,章程也允许各商会「就地与各会董议定便宜章程」,只要「无背商部定章」即可——这种弹性在实践中意味着各地的记录标准仍然不统一。到 1911 年,四川全省各商会召开联合大会时,与会代表仍在抱怨章程规定不足,「一遇事实之发现有非章程所规定者,辄疑畏不前」。

标准立起来了,但标准之下的执行千差万别。这个模式在此后一百二十年里会反复出现——本系列第一篇讨论的《经营范围规范表述目录》,本质上面对的是同一类问题:统一了表述形式,统一不了填报的真实性。

三、行会名录:前登记时代的信息载体

在政府登记制度建立之前,中国的工商信息以什么形式被记录下来?

主要是三类载体。

第一类是行会与公所的会员簿册。 加入行会需要缴纳会费、接受同业约束,会员名单因此有实际的管理需要。簿册通常记录字号、东家姓名、籍贯、开业时间、店铺位置,有些还记录了资本额与营业范围。

这类记录的准确性相当高——因为它服务于内部管理,虚报没有好处。但它的覆盖范围严格限于会员,非会员完全不在其中,而且不同行会之间的记录彼此不通。

第二类是同业公会与商会编印的会员录。 商会体系建立之后,各地商会陆续编印会员名录,部分名录还按行业分类,并附带简要的行业统计。这已经很接近现代意义上的工商名录了。

第三类是商业性的出版物。 晚清民初的通商口岸城市,出现了各种「商务指南」「工商指南」「行名录」类的出版物,由书局或者广告商编纂,收录当地商号的字号、地址、电话、主营业务,收入主要来自广告。

第三类在形态上已经与后来的黄页几乎完全一致:内容是免费收录加付费加粗,商业模式是广告。 这个模式此后活了将近一个世纪,直到互联网时代才被取代——而取代它的 B2B 平台,商业模式其实是同一个。

三类载体的共同问题是边界与更新。行会簿册的边界是会员,商会名录的边界是入会商号,商业指南的边界是编者跑得到的街区。而所有这些记录,一旦印出来就开始过期,下一次更新要等到下一版。

在这个时期,一个商人如果要找一家外地的工厂,最可靠的办法仍然不是查名录,而是写信托人打听。名录的作用是提供候选,人的关系提供确认。

候选靠信息,确认靠关系。 这个分工在此后的一百二十年里非常顽固——直到今天,在很多制造业交易中,最终的确认仍然依赖实地考察和熟人背书。数据能做的是把候选池从三家扩大到三百家,把确认成本从一个月压缩到三天,但它至今没有完全取代确认环节。

四、1918:商务印书馆的一本名录

在商会名录与行会簿册之外,中国第一部真正意义上的企业黄页,出自一家出版社之手。

1909 年,商务印书馆出版了一部叫《上海指南》的实用性图书,销量很大,一版再版。商务的灵魂人物张元济始终关注这本书的增订修改,他的馆事日记里留下了许多记录,连广告、印数都由他一锤定音。

1917 年 6 月 15 日,张元济在日记「编译」栏写道:「锡三来言,本馆可做一《中国行名簿》,将《上海指南》修改。」建议者的想法是,乘修改《上海指南》的机会,编一本「中国行名簿」。次日,张元济亲自「查《名簿》调查稿」,并复信说,《上海商业名簿》可以改称《名录》。

1918 年 7 月,《上海商业名录》由上海商务印书馆初版,编纂人徐珂。它被后来的研究者视为中国首部企业黄页,附有广告页——也就是说,从第一天起,它就采用了「收录免费、广告付费」的商业模式。

这本书的诞生过程,藏着三个值得今天从业者注意的细节。

第一,它从一本城市指南「长」出来。 《上海指南》本来是给到上海的人看的:怎么坐车、住哪里、去哪办事。企业名录是它的一个附属部分,因为读者反复查那一部分,才被独立出来做成一本书。需求先于产品,而且需求是从使用行为里观察出来的——这与今天从查询日志里发现用户真实需求的做法,逻辑上完全一样。

第二,它的采集方式是「调查稿」。 张元济「查《名簿》调查稿」,说明名录的内容不是从官方登记里抄来的——当时也没有可抄的登记——而是派人逐家调查得来的。这是本文第一部反复出现的那个模式:在登记制度覆盖不到的地方,商业机构用自己的腿去补。

第三,出版决策者亲自审稿。 名录这种产品,错一条地址、错一个字号,读者按图索骥就会扑空。张元济亲自查调查稿,反映的是当时对准确性的要求,也反映了一个事实:在没有反馈回路的纸质时代,出版前的人工核验是质量的唯一保障。

「行名录」后来成了各个开埠城市商业指南的总称,因出版商不同,命名也不尽相同。这类出版物延续了几十年,直到 1940 年代仍在出版。1944 年 1 月出版的《上海行名录》,全书分为五类:上海各大工厂,上海金融市场,上海贸易商与普通商号,上海旅馆、酒菜馆、浴堂、理发室、娱乐场所,以及其他,附录上海百业人士住址。

请注意这个分类的第一项:「上海各大工厂」被列在最前面。 在 1918 年的初版里,名录的主体是商号;到 1944 年,工厂已经成为名录的首要对象。二十六年间,上海的经济结构从商业城市向工商业城市转变,名录的结构随之改变。

名录是一面镜子,它的分类方式反映的是编纂者眼中「什么最值得被找到」。1944 年的编纂者认为工厂最值得被找到——这个判断,此后八十年没有变过。

还有一个细节:附录是「百业人士住址」。也就是说,1944 年的名录已经把「人」作为一个独立的检索维度收录进来——不只是找企业,还要找到企业里的具体的人。本系列第一篇文章把「谁能拍板」列为八个字段里最难的一格,而这一格在纸质名录时代就已经存在了,只是当时收录的是地址而不是电话,因为电话还是稀罕物。

从商务印书馆的调查稿,到今天的多源交叉核验,采集的手段换了无数代,但采集这件事本身——有人得去把每一条信息弄清楚——一直没有消失。

五、1923:第一部工厂法性质的法规

1923 年,北洋政府农商部颁布《暂行工厂通则》,共二十八条,内容涵盖工人年龄、工作时间、休息、工资、女工童工保护等。

这是中国第一部具有工厂法性质的法规。

它在本文的语境里之所以重要,不在于它的劳工保护条款——那些条款在当时基本没有得到执行——而在于它第一次在法律上定义了什么是「工厂」。

要保护工人,先要界定哪些场所适用这部法规;要界定适用范围,就必须给出「工厂」的判定标准。通常的做法是按使用动力设备与否、雇工人数多少来划线。

这个动作看起来很技术,实际上是所有工厂统计的起点。本系列第一篇文章用了整整一章讨论「经营范围为什么不能用来判断是不是工厂」,而这个问题的源头,就在于**「工厂」从来不是一个自然类别,而是一个需要人为划定的法律与统计类别**。

划在哪里,直接决定了统计出来的数字。

1923 年划的线、1929 年《工厂法》划的线、1950 年工矿企业普查划的线、2011 年规模以上工业企业「年主营业务收入 2000 万元」划的线、以及今天各家商业数据库各自划的线——每一条线都是一次人为选择,每一次选择都对应一个不同的总数。

这就是为什么本系列反复强调口径。口径不是学术上的讲究,它是这个问题的本体。

六、1929:一部推迟了十九个月的法律

1929 年 12 月 30 日,南京国民政府颁布《工厂法》,共十三章七十七条。

法律原定于 1930 年 2 月 1 日起施行。但因为多方反对,实施日期一再推迟,最终到 1931 年 8 月 1 日才正式生效——从颁布到施行,中间隔了十九个月。

1930 年 2 月,政府公布《工厂法施行条例》,共七章五十八条,对《工厂法》的实施细则作了详细规定,包括工厂的登记程序、检查机构的职责权限、违反法规的处罚措施。

《工厂法》明确规定了工厂的定义、雇主与工人的权利义务关系,在劳工权益保护方面涵盖了工作时间、休息休假、工资待遇、女工童工保护、劳动安全与卫生等内容。按照规定,成年工人每日工作时间不得超过八小时,女工不得超过七小时,童工不得超过六小时。

这部法律的立法背景包含一层国际因素:南京国民政府在筹备制定《工厂法》期间,与国际劳工组织的关系明显增进,急需其经验指导。此后几年间,政府又陆续制定了《工厂检查法》《工会法》《团体协约法》等一系列劳工立法,初步构建起劳工法制的框架。

那十九个月的推迟,本身是一个信息问题的产物。

反对的理由集中在一点:法律定的标准,与工厂的实际状况差距太大。 每日八小时、女工七小时、童工六小时——在 1930 年的中国工厂里,这些条款意味着大部分企业将立刻违法。

而政府之所以会定出与实际差距如此之大的标准,一个直接原因是它并不真正知道自己的工厂是什么样子。立法参照的是国际劳工组织的公约文本和先进国家的经验,不是本国工厂的实测数据——因为本国工厂的实测数据当时还不存在。

先有法律,后有调查;先定标准,再去看现实对不对得上。这个顺序在此后的中国工业管理史上出现过很多次,本系列第一篇文章讨论的数据要素制度建设,某种意义上也是同一个顺序:制度框架先行,基础数据后补。

顺序本身不必然是错的。框架可以引导调查的方向,标准可以创造收集数据的动力。问题只在于,如果框架立起来之后,基础数据始终没有补上,那么框架就会长期悬空。

《工厂法》的命运正是如此。它在 1931 年生效,六年之后全面抗战爆发,工厂大规模内迁,法律的执行环境彻底改变。留下来的不是它的劳工条款,而是它为了执行这些条款而不得不建立的另一套东西——工厂登记。

七、1931:二十五项与一份年度报告

为调查了解全国工矿企业情况,南京国民政府实业部于 1931 年公布《工厂登记规则》。

这是本文序章提到的那份文件。它的核心内容有三条:

第一,工厂除依其他法规登记注册外,还需另行办理工厂登记。 也就是说,公司登记与工厂登记是两回事——一个企业即使已经完成了商业登记,只要它有生产行为,还要单独做一次工厂登记。

这个设计在今天看来非常有启发。本系列第一篇文章花了整整一章讨论「登记为制造业的不一定生产、实际生产的不一定登记为制造业」,而 1931 年的做法是把两件事分开登记:商业身份走一套,生产身份走另一套。

第二,登记附表的事项多达二十五项。 规则对登记事项规定得非常详细,覆盖了工厂的基本信息、设备、动力、人员、产品等多个维度。

第三,工厂必须每年填报「厂务报告」。 这是一次性登记之外的持续义务——登记不是一劳永逸的,而是需要年度更新的。

三条合起来,构成了一个在制度设计上相当完整的方案:分离生产身份、多维度采集、年度更新。

本系列第一篇文章在讨论数据保质期时得出的结论是:产业数据的维护成本不由字段总数决定,而由更新最频繁的那几个字段决定;一套数据的整体新鲜度取决于其中最快失效的那个字段;因此这门生意的竞争最终落在运营能力上而不是采集能力上。

1931 年的《工厂登记规则》在制度上已经预见到了这一点——它要求年度报告,正是因为立法者知道一次性登记的信息会过期。

此后这套制度还在继续完善。1937 年,国民政府成立经济部(前身即实业部),由经济部工业司掌管「工厂登记及考核事项」和「工业团体之登记及监督事项」,登记与考核被放在同一个职能部门里。1941 年 3 月,经济部重新修订《工厂登记规则》,进一步完善了工厂登记的范围和条件,工厂登记表的内容更加详细、项目更加规范。

在战争年代还在两次修订登记规则、还在把登记表做得更细——这件事本身说明当时的管理者非常清楚工厂信息的价值。战时的物资调配、军工订货、工厂内迁,每一件都需要知道全国有哪些工厂、在哪里、能造什么。

需求越紧迫,对信息的要求越具体。这条规律在此后每一次产业动荡中都会重现。

同一时期,实业部还配套推出了针对小微制造主体的政策。1931 年 5 月,实业部颁布《小工业及手工业奖励规则》,奖励对象包括「对于各种制造品有特别改良者」「应用外国成法制造物品确属精巧者」「擅长特别技能制品优良者」。同年 12 月,实业部中央工业试验所成立。

奖励规则的存在,说明立法者意识到了工厂登记覆盖不到的那一大片——小工业与手工业。这个覆盖盲区,与本系列第一篇文章讨论的「个体工商户形态的加工厂不进入制造业企业统计」是同一个问题,中间隔了九十五年。

八、1933:一次没有做完的全国调查

有了登记规则,还需要有调查。登记是被动的——企业来登记才有记录;调查是主动的——调查者去现场采集。

1930 年代,民国政府实业部国际贸易局组织了一项庞大的调查工作,成果以《中国实业志》为名陆续出版,副题是「全国实业调查报告」。

这项调查的规模在当时是空前的。它的原计划是对全国各地进行全面调查,按省编纂出版。实际出版的部分包括江苏、浙江、山东、湖南、山西五省,其中江苏、浙江在前,山西为一部三册,湖南省一卷初版于 1935 年 10 月。

调查的内容极为详细。以省为单位,逐一记录当地的工业门类、代表性工厂、产量、销路、原料来源、技术水平、劳动力状况。它不只是名录,还包含大量的实地观察与产业判断。直到今天,研究民国时期区域工业史的学者仍然把《中国实业志》当作核心史料——包括与地方志材料反复比对印证的基准来源。

但这项工作没有做完。原计划覆盖全国,实际只出了五个省。中断的原因是战争。

五个省。这个数字值得停下来想一想。

江苏、浙江、山东、湖南、山西——这五个省在当时确实是工业相对集中的地区,但全国有二十多个省。也就是说,这次中国近代史上规模最大的实业调查,最终覆盖了不到四分之一的省份,而且这四分之一的数据也没有统一的时点。

从数据方法论的角度看,《中国实业志》暴露了一个此后一再重复的困难:全面调查的成本极高,而它的价值只有在完成时才能兑现。

调查了五个省的数据,其价值远不到全国调查的四分之一。因为产业分析的很多问题——某个品类的全国产能分布、上下游的地理关系、区域之间的竞争与配套——本质上要求全国视野。缺了三分之二的样本,这些问题一个都答不了。

这是产业数据领域一个非常残酷的性质:它的价值曲线是非线性的。 覆盖 25% 的数据,价值远不到完整数据的 25%;而覆盖 90% 与覆盖 99% 之间的价值差距,又可能超过前面 90% 的总和——因为使用者需要的是「能不能相信这个池子是完整的」。

一百二十年后,这条性质仍然成立,而且是所有产业数据从业者最难向投资人解释的一条:为什么投入了这么多,产品还不能用。答案是,在跨过完整性阈值之前,它确实不能用。

九、1933:六十个人

1933 年,中央工厂检查处在上海创办工厂检查人员养成所,从全国选派六十名学员进行培训,内容涵盖工厂法、工厂管理、安全卫生知识等,培训合格后派往各地执行工厂检查事务。

六十个人,要检查全国的工厂。

这个数字的荒诞感是有价值的,因为它把一个抽象问题变成了具体的算术:采集能力的物理上限。

假设一名检查员一天能完成一家工厂的检查(考虑到当时的交通条件,这已经是乐观估计),一年工作二百五十天,六十个人一年能覆盖一万五千家工厂——前提是他们不需要往返、不需要写报告、不需要处理纠纷。实际能完成的数量恐怕是这个数字的几分之一。

而当时全国有多少工厂?没有人知道,这正是要调查的原因。

采集能力与采集对象规模之间的这个缺口,是贯穿本文全篇的主线之一。它在每一个时代都以不同的形式出现:

  • 1933 年,缺口是六十名检查员对全国工厂;
  • 1950 年代,缺口是普查员数量对全国工矿企业;
  • 1990 年代,缺口是黄页编辑对全国商号;
  • 2010 年代,缺口是网页抓取能力对全网信息;
  • 今天,缺口是核验能力对存量记录——第一次把几百万家企业信息采集完整是可以完成的工程,而每年让这几百万条记录保持有效则是一项永不结束的任务。

技术进步做的事情,是不断把这个缺口往后推,但从未消除它。每一次采集能力提升,采集对象的范围与要求的精细度也同步提升,缺口重新出现在新的位置上。

理解了这一点,就能理解为什么产业数据领域没有「一劳永逸」的解决方案,也不该期待有。

十、三四百户:一个数字的解剖

1933 年,据汉口社会局调查,当地符合实业部工厂法规定的工厂「恢复到三四百户」。

汉口在当时是长江中游最重要的工商业中心之一,九省通衢,有较为发达的近代工业。而它符合《工厂法》定义的工厂,只有三四百家。

这个数字小得反常。解剖它,可以看清「工厂数量」这类统计的全部构造。

第一,「符合工厂法规定」这个限定词决定了一切。 《工厂法》对适用范围有明确的门槛——通常按是否使用动力设备、雇工人数是否达到一定规模来界定。门槛之下的作坊、手工工场、家庭工业,全部不计入。而在 1930 年代的中国,门槛之下的生产单位在数量上是压倒性的。

第二,「恢复到」三个字透露了时间背景。 这个数字是一个恢复期的读数,此前经历过下滑。产业统计的数字永远是某个时点的切片,脱离时点谈数字没有意义。

第三,这是「社会局调查」的结果,不是登记结果。 也就是说,即便《工厂登记规则》已经颁布两年,实际掌握本地工厂状况仍然要靠专门的调查。登记制度的覆盖率显然远不够用。

三条合起来,可以还原出一个完整的统计口径:某个时点、某个行政区、按某部法律的门槛定义、通过专项调查方式得到的、符合条件的工厂数量。

去掉任何一个限定词,这个数字都会变成另一个数字。

本系列第一篇文章用一整章讨论「每个数字都必须挂一个口径」,并列举了当代的三组例子——规模以上工业企业 43.6 万家、制造业企业 246 万家、第五次全国经济普查口径下的制造业法人单位 404.9 万家。这三个数字之间的关系,与 1933 年汉口的「三四百户」和当地实际存在的生产单位数量之间的关系,在结构上完全一样。

九十三年过去,工具全变了,问题一个字没变。


第一部到此结束。1937 年之后,工厂大规模内迁,调查与登记的环境彻底改变,《中国实业志》的全国计划就此中断。此后十余年,工厂信息的组织进入战时状态——它服务于物资调配与军工生产,而不再服务于市场上的买卖双方。

再往后,中国进入了一个完全不需要「找厂」的年代。

十一、1941:战时的登记

1937 年全面抗战爆发之后,沿海与沿江的工厂大规模向内地迁移。同年,国民政府将实业部改组为经济部,工厂登记的职能随之转入经济部工业司——该司掌管「工厂登记及考核事项」和「工业团体之登记及监督事项」。

请注意「登记」与「考核」被放进了同一个职能里。和平年代的登记是了解性的:政府想知道有什么。战时的登记是调配性的:政府必须知道有什么,才能决定把有限的原料、电力、运力、订单分给谁。内迁工厂要重新落地、重新开工、重新进入供应链,每一步都需要主管部门掌握它的位置、设备、产能与产品。

于是出现了一个乍看不合常理的现象:在战争最艰难的年份,登记规则反而被修得更细了。 1941 年 3 月,经济部重新修订《工厂登记规则》,进一步完善了工厂登记的范围和条件,登记表的内容更加详细,项目更加规范。

这与本部前面讨论的《中国实业志》形成了一组对照。《中国实业志》是了解性的全国调查,战争一来就中断了,五个省之后再无下文;《工厂登记规则》是调配性的登记制度,战争一来反而被强化了。两者的差别不在技术条件——同样的战时环境——而在信息的用途:用于了解的信息,需求可以推迟;用于分配的信息,需求不能推迟。

本文第二部会看到同一条规律的另一个版本:1950 年的工矿企业普查之所以能完成,是因为它服务于接管与计划,而不是服务于了解。第六部还会看到它的当代版本:数据资产入表在制造业推进最快,是因为那些企业有真实的融资诉求。

信息的完整性,与它被用来做什么决定成正比。 这条规律在 1941 年就已经写得很清楚了。

战时登记还留下了一个方法上的细节。内迁工厂在迁移过程中,名称、地址、隶属关系频繁变动——一家上海的机器厂迁到重庆之后可能改了名,与另一家厂合并之后又改了一次名。登记机关要把迁前、迁中、迁后的记录对应到同一家企业上,才能保证考核的连续性。这是「实体对齐」问题在中国工业史上第一次以规模化的形式出现,比本文第二部要讲的三线企业「代号」问题早了二十多年。

登记做得再细,也覆盖不了战时的全部生产活动——大量小型作坊、军需临时工场、合作社工业都在正式登记之外。1941 年的登记规则与 1931 年一样,在覆盖率上远未达到它的设计意图。但它把一件事固定了下来:当一个组织真正需要知道自己有多少家工厂时,它会把登记表做得越来越细,而不是越来越粗。

九十五年后,这个趋势没有变。

第二部 目录的时代(1949—1978)

十二、1950:从工矿企业普查开始

中国现代经济普查的历史,起点是 1950 年的全国工矿企业普查。

此后半个世纪里,国家先后完成了三次工业普查(含这次工矿企业普查)、一次第三产业普查、两次基本单位普查。2003 年,国务院决定将工业普查、第三产业普查和基本单位普查合并,并将建筑业纳入普查内容,统称为经济普查,2004 年开展第一次全国经济普查。

1950 年那次普查的性质,与本文第一部讨论的《中国实业志》调查有一个根本区别。

《中国实业志》是一次了解性调查——调查者想知道这个国家有什么,以便制定政策、发展实业。它面向的问题是开放的。

1950 年的工矿企业普查是一次接管性清点。新的经济管理体系正在建立,需要先弄清楚接手的是什么:有多少厂、在哪里、什么设备、什么产能、多少工人。清点的结果直接进入此后的计划编制。

这两种性质的调查,对数据的要求完全不同。

了解性调查追求代表性和洞察力,它可以抽样,可以侧重典型,可以带有调查者的产业判断。清点性调查追求穷尽和准确,它必须覆盖全部对象,每一项都要能对得上账,因为下一步的资源分配要按这份账来做。

清点的动力比了解的动力强得多。 这也是为什么 1950 年的普查能够完成,而 1930 年代的《中国实业志》只做了五个省——不是技术条件的差别,是使用目的的差别。当数据要直接用于分配资源时,收集它的组织意志会强得多。

这条规律在今天依然成立。本系列第一篇文章观察到,数据资产入表在制造业非上市公司中推进最快,原因之一是这些企业有真实的融资诉求——数据要用于增信,收集和归集它才有动力。数据的质量,取决于它被用来做什么决定。

十三、1955:一个词的替换

1953 年起,中国开始实行计划经济。在工业品流通上,少数产品由国家统购包销,多数产品仍以加工订货为主,企业根据加工订货量以销定产。

1955 年 9 月,机械产品被纳入国家计划生产、统购包销,销售形式确定为**「调拨」**。

从「销售」到「调拨」,一个词的替换,改变了工厂信息的全部逻辑。

在销售逻辑里,工厂必须被买方找到。找不到就没有订单,所以工厂有动力让自己被看见——登广告、印样本、参加展会、加入行会。信息的流动方向是从工厂向外。

在调拨逻辑里,工厂不需要被买方找到,它只需要被主管部门知道。部门根据计划分配任务,工厂按任务生产,产品按计划调走。信息的流动方向变成了工厂向上、部门向下。

这个转变的直接后果是:面向社会的工厂信息,失去了存在的理由。

一家 1960 年代的机械厂不需要向外界介绍自己能做什么,因为不会有陌生的买家来找它;它也不需要知道同行在做什么,因为它不与同行竞争订单。它需要知道的只有两件事:上级下达的任务,以及配套单位是谁——而这两件事都由计划体系告诉它。

于是,工厂信息在这个时期高度集中于主管部门内部,以计划表、产品目录、配套关系表的形式存在,不公开发行,也没有公开的必要。

这不是信息的消失,而是信息组织方式的迁移:从面向市场的公开名录,迁移到面向管理的内部台账。

从数据的角度看,内部台账其实有一个巨大的优势——它极其完整、极其准确。计划体系必须知道每一家企业的准确产能,否则计划就编不平。在那个年代,主管部门掌握的工厂数据,在完整性和准确性上可能超过此后任何一个时期。

代价是它不可访问。它服务于分配,不服务于发现。

十四、订货会:另一套供需匹配机制

计划分配无法解决所有问题。机械产品的品种规格极多,需求也在不断变化,纯靠指令性计划难以匹配。于是出现了一套补充机制:订货会。

全国机械行业实行一年两度的排产订货会议,会议决定企业的生产量。在这套体系中,企业仅仅是生产单位,产品销售受上级主管部门支配。

订货会的运作方式,是把全国的供需双方在同一个时间、同一个地点集中起来,用几天到十几天的时间完成一年的供需匹配。需方带着需求清单来,供方带着产能和样品来,会上谈定,签订合同,会后执行。

如果剥离掉计划经济的外壳,只看信息机制本身,订货会做的事情非常清晰:用空间和时间的集中,来对冲信息传输的困难。

在信息无法远距离低成本流动的条件下,让所有人到同一个地方去,是最有效的解决方案。你不需要知道全国有哪些厂能做某个零件,你只需要到会场上走一圈。

这套机制的效率在特定条件下相当高。改革开放初期的一组数据可以说明它的量级:1980 年 8 月,首次在长沙召开的全国机电产品订货会上,仅武汉市机械工业局下属六大行业、21 个公司(总厂)的成交额就达 2 亿余元,占此次订货会成交额的 2%,约相当于该局 1980 年工业总产值的三分之一。

一个地级市的机械系统,在一次订货会上做成的生意相当于全年产值的三分之一。这说明当时的订货会不是形式,而是实实在在的交易场所。

同时,2% 这个占比也说明了这次订货会的总规模——约 100 亿元量级的成交额,集中在几天之内、一个会场里完成。

订货会的逻辑至今没有消失。今天的行业展会、采购对接会、产业带对接活动,本质上都是同一套机制的延续:当信息无法有效地远程传递时,就让人聚在一起。

本系列第一篇文章在讨论「向工厂销售的获客环节」时,把展会列为替代方案之一,并指出其投入产出比波动极大、覆盖窄。这个评价放在今天成立,但需要补充一句:展会之所以在信息如此发达的今天仍然存在,正是因为远程信息至今没有完全解决「确认」这个环节。第一部讨论过「候选靠信息,确认靠关系」,订货会与展会解决的一直是后半句。

十五、产品目录:计划体系里的数据库

计划体系需要一套自己的信息基础设施,其中最重要的一项是产品目录。

各工业主管部门组织编制本行业的产品目录,登记产品的名称、型号、规格、技术参数、生产单位。目录的作用是让计划编制者知道:某种产品由哪些厂生产、性能如何、能不能替代。

这类目录一直延续到改革开放之后。相关主管部门长期承担着组织审定并颁发汽车、改装车、摩托车等产品目录的职能;直到今天,工业主管部门仍会发布重点行业的技术进步和技术改造项目及产品目录,覆盖家电、轻工机械、五金制品、照明电器、缝纫机、电池等领域。

产品目录在信息结构上,与今天的产业数据库有惊人的相似之处:

  • 它以产品而不是以企业为主索引——这与本系列第一篇讨论的「以主体为中心还是以场景为中心」正好是另一个选择;
  • 它包含型号与技术参数,粒度远细于国民经济行业分类的小类;
  • 它由主管部门审定,具有权威性;
  • 它定期更新,新产品入目录、淘汰产品出目录。

从数据质量的角度看,产品目录在它的适用范围内,质量高于今天任何一个商业数据库:参数经过审定、生产单位经过核实、更新有制度保障。

它的局限也同样清楚:

其一,只覆盖计划内产品。 目录之外的东西不存在——不是没有人生产,而是不进入这套体系。

其二,服务于分配而不是发现。 目录回答「这个产品由谁生产」,不回答「这家工厂还能做什么」。它是产品视角,不是主体视角。

其三,不面向社会开放。 使用者是计划部门和配套企业,不是市场上的任何人。

这三条局限合起来,导致了一个后果:当市场经济回来的时候,这套高质量的信息基础设施无法直接转用。

一个 1985 年想要采购某种轴承的乡镇企业,无法从机械工业部的产品目录里得到帮助——它拿不到目录,即使拿到了,目录也只会告诉它计划内的定点厂是哪几家,而那几家厂的产品早已被计划分配完毕。

它需要的是另一套东西:一份面向所有人开放的、包含计划外产能的、按需求而不是按分配组织的名录。

这套东西在此后二十年里被慢慢造了出来,造它的不是政府部门,而是市场。

十六、1957:一个展馆的开幕

1957 年 4 月 25 日,第一届中国出口商品交易会在广州中苏友好大厦开幕。

这场后来被称为「广交会」的展会,创办于 1957 年春季,此后每年春秋两季举办,是中国目前历史最长的综合性国际贸易盛会,被称为「中国第一展」。

在本文的语境里,广交会的意义不在于它的贸易额,而在于它是那个年代唯一一条面向境外的工厂信息通道。

一个海外采购商想知道中国能生产什么、由谁生产、质量如何、价格多少,在当时几乎没有别的渠道可以获得这些信息。没有可查的名录,没有可访问的目录,没有可以直接联系的工厂。他只能来广州,在会场里看实物、谈价格、下订单。

一年两次、一个城市、一个展馆,承载了一个国家全部的对外工业信息交换。

这个结构的信息带宽极窄,但它是可控的、可组织的、在当时条件下可实现的。广交会长期坚持的「重合同守信用」「重质先于重量」理念,本质上是在用制度性的信誉承诺,替代买方无法独立获取的供应商信息——买方无法核实一家中国工厂的可靠性,那就由展会这个组织者来承担信誉背书。

用组织信誉替代主体信息。这个思路此后被反复使用:B2B 平台的「诚信通」认证是它,第三方验厂机构是它,行业协会的会员资格也是它。当买方无法直接验证卖方时,市场会自发生成一个中间的信誉承担者。

而这个中间者存在的前提,恰恰是主体信息不透明。信息越透明,中间者的溢价空间越小。这条判断在本文第六部还会回来。

十七、四次搬家

广交会从 1957 年创办以来,先后四次更换会址:广州中苏友好大厦、侨光路展馆、起义路展馆、流花路展馆、琶洲会展中心。

更换会址的原因只有一个——场地不够用了。

搬家的时间线,本身就是一条中国出口能力的增长曲线:

  • 1957 年 4 月,第 1 届在中苏友好大厦举办;
  • 1958 年 4 月,第 3 届迁至广州市侨光路的中国出口商品陈列馆,展馆共 5 层、展览面积 1.3 万平方米;
  • 1959 年 11 月,第 6 届第二次迁址到起义路的新建陈列馆,展馆共 10 层、展览面积 3.45 万平方米;
  • 此后迁至流花路展馆;
  • 2003 年,第 94 届在琶洲广州国际会展中心试运行。

从 1.3 万平方米到 3.45 万平方米,用了一年半。琶洲展馆此后历经四期建设,到 2008 年第 104 届实行「一届三期」时,展览面积超过 100 万平方米,规模跃居世界第一。

会期的变化也是一条曲线:从 1987 年第 61 届起,会期改为 20 天;1989 年第 65 届起改为 15 天;2002 年春季第 91 届首次实行一届两期,每期五天半,两期之间的四天为换展期;2008 年第 104 届实行一届三期,每期展览时间五天。

会期在缩短,面积在扩大,分期在增加。这三条趋势指向同一件事:参展主体的数量增长速度,远远超过了展会这种形式的承载能力。

一届三期、每期五天,意味着一个采购商在一次广交会上最多只能看到全部展商的三分之一——除非他在广州待满整个会期。而即便待满,一百万平方米的展馆,一个人也不可能走完。

展会作为信息交换机制,在物理上是有天花板的。 这个天花板在 2008 年前后已经清晰可见。

此后的变化是往线上走。2020 年,第 127 届广交会在网上举办,此后第 128 届、129 届、131 届也在网上举办;2021 年 10 月第 130 届首次实现线上线下融合举办。

线上化解决了承载量的问题,但同时也削弱了展会最核心的价值——面对面的确认。一个采购商在展台上可以摸到样品、看到工厂负责人的表情、当场问出十几个问题;在网页上他只能看到图片和文字。

承载量与确认力,这两件事在展会这个形式里是互相冲突的。 这个冲突至今没有被解决,也是为什么在线上化多年之后,线下展会依然存在。

十八、1964:信箱

目录时代还有一段必须记录的历史,它把「工厂信息不面向社会」推到了逻辑的尽头:工厂不仅不需要被找到,连名字都不需要存在。

1964 年起,以「备战、备荒、为人民」为方针的三线建设在中西部地区展开。此后十余年,三线地区先后建成 400 多个军工企业、80 多个国防科研院所,在大后方建成了包括兵器、航空、航天、船舶、电子和核工业等重要部门在内的比较完整的国防工业与战略后方基地。三线建设之前,52% 的国防工业集中在 14 个百万人口以上的大城市;三线建设改变了这一布局。

高度保密性是三线建设的重要特点。为保密需要,从上至下都制定了严格的规定:三线企业一律使用代号,通信联络以代号作为邮寄地址,家人亲属之间也必须严格遵守保密要求。作为三线建设重点的攀枝花,其厂矿企业按行业领域分别以「一号信箱」到「十五号信箱」称呼和代替。在青海大通县,704、705、706 等一组数字代号对应着一批工厂,直到多年后才随着相关基地退出历史舞台而「解密」。在山西晋东南,一家属于第四机械工业部的电子工厂,在几十年里的名字就是「4402 厂」。

从工厂信息的角度看,「信箱」制度是一种制度性的隐身。

一家工厂存在,有厂房、有设备、有几千名职工、有稳定的产品,但它在任何面向社会的信息体系里都不存在。它的名字是一个数字,它的地址是一个信箱,它的产品不进入任何公开目录。知道它的人只有主管部门和配套单位,而这些人被要求不向外透露。

这当然是特定历史条件下的必要安排,本文无意评价。本文关心的是它留下的两份遗产。

第一份遗产是「代号—现名」的对齐难题。

改革开放之后,三线企业陆续调整、搬迁、改制、更名。一家工厂可能经历了从数字代号到「××机械厂」再到「××股份有限公司」的多次更名,中间还可能有合并、分立、迁址。要把今天某家上市公司的历史追溯到它在 1960 年代的代号,需要专门的考证。

本系列第一篇文章用一整章讨论「实体对齐」——判断两条记录是不是同一家企业。三线企业的更名史,是这个问题在时间维度上的极端版本:同一家工厂在六十年里可能用过五六个名字,其中一个还是纯数字。任何一套试图建立中国工业企业完整历史的数据库,都绕不开这道题。

第二份遗产是一整批「不出现在任何商业信息里的优质产能」。

三线企业中的相当一部分,改制后仍然是各自领域的重要制造主体——精密机械、特种材料、电子元器件、光学仪器。但它们的历史基因决定了它们的信息习惯:不做推广、不上平台、不接陌生询盘,客户关系高度固定。

本文第四部讨论平台时代的「会员制极限」时会指出:平台收录的是愿意花钱被找到的企业,而不做推广的优质产能在任何平台上都查无此厂。三线企业是这类主体的典型——它们的隐身,一半来自历史,一半来自商业模式。

要把这类主体纳入产业数据,不能靠等它们来登记,只能靠从公开的硬信号里把它们识别出来:招聘、专利、资质、中标记录。这些信号它们躲不掉,因为它们要招人、要申报、要投标。

从「信箱」到「硬信号识别」,中间隔了六十年。而这六十年里,这批工厂一直在那里生产,只是长期没有人能从外面看见它们。

十九、「14 台」与「04 台」

在工厂信息的历史里,有一条容易被忽略的线索:电话查号台。

1975 年,由上海市内电话局的「09」台与国民政府交通部时期创办的「14」台合并而来的「04」查号台,正式更名为「114」查号台,这被视为中国电信 114 的开端。

一个细节值得注意:「14」台的历史可以上溯到民国时期的交通部。 这意味着电话查号服务在中国的连续性,比大多数工商信息服务都要长——它跨越了 1949 年,以机构合并的方式延续下来。

1982 年,邮电部正式下发通知,要求市话查号台「114」全面接入社会民生,为广大群众以及各个企业提供查号服务。

查号台在本文语境中的重要性,在于它是计划经济时期唯一一条面向社会开放、可以查询企业联系方式的公共信息通道。

它的信息结构极其简单:单位名称到电话号码的映射。没有产品,没有产能,没有规模,没有分类。但它解决了一个最基础的问题——如何联系上一个你知道名字但不知道号码的单位。

而且它是「拉」的模式:使用者主动提问,服务方按需回答。这与目录的「推」模式(编好了发给你)完全不同,在结构上更接近今天的检索服务。

1999 年,114 构建了延伸服务台「88114」万事通信息台,提供覆盖衣食住行游娱购的日常实用信息;此后又升级为「号码百事通」,从号码查询转向综合信息搜索服务,先后推出查询转接、订餐、导航等服务。

这条演进路径——从单一号码查询,到综合信息服务,再到多平台触点——与商业信息服务的演进路径高度平行。它说明一件事:任何一个能够回答「怎么联系上他」的服务,都会自然地被使用者追问「他是谁、他能做什么」,从而被推着扩展维度。

今天的企业查询工具走的是同一条路:从工商信息查询起步,然后被追问司法风险、然后被追问经营状况、然后被追问产业属性。用户的追问方向是固定的,因为背后的商业问题是固定的。

二十、目录时代的遗产

1978 年之前的近三十年,在工厂信息的组织上留下了三份遗产。

第一份遗产是完整的主体台账。

计划体系要求对生产单位有准确的掌握,因此在体系内部,工厂的名称、隶属关系、产能、设备、人员是清楚的。这份台账在改革开放之后成为工业统计的基础,1985 年第二次全国工业普查能够顺利展开,与此有直接关系。

第二份遗产是产品分类与技术标准体系。

产品目录、行业标准、技术规范,在这一时期建立起相当完整的体系。今天的国民经济行业分类、产品分类目录,其骨架大多可以追溯到这个时期。

这份遗产的两面性在本系列第一篇文章里讨论过:分类体系保证了统计的连续性和可比性,同时也因为它服务于统计而非检索,粒度对商业应用来说明显不够。

第三份遗产是「找厂」这件事的空白。

三十年里,市场上没有「找厂」这个需求,因此也没有任何面向社会的工厂信息服务被发展出来。没有商业名录出版业,没有信用评估机构,没有中介服务市场。

这个空白在 1978 年之后立刻变成了问题。当企业重新需要自己找买家、自己找供应商时,它们发现:没有工具。

于是有了下一部要讲的故事——用二十年时间,从零开始,把一套面向市场的工厂信息基础设施重新造出来。

第三部 名录的时代(1978—1998)

二十一、1979:把「卖」还给工厂

1979 年 8 月以后,机械产品的流通体制改革启动:统购包销改为计划收购和企业自销,由产品经济向商品经济过渡。

「企业自销」四个字,把一件工厂已经三十年不需要做的事情还给了工厂:自己把东西卖出去。

这件事的难度在当时被严重低估了。一家 1979 年的机械厂,厂里没有销售部门——过去不需要;没有客户名单——客户是调拨单上的收货单位,不是自己找来的;没有市场信息——不知道谁需要自己的产品,不知道同类产品有几家在做,不知道该定什么价。

更根本的是,整个社会没有为「企业互相寻找」准备任何基础设施。没有面向社会的企业名录,没有行业媒体,没有广告市场,电话普及率极低,唯一的公共查询通道是 114 查号台——而查号的前提是你已经知道对方的名字。

供需双方重新获得了交易的自由,却没有获得找到彼此的手段。

这个缺口催生了 1980 年代一个特殊的职业群体:供销员。

供销员是企业派出去的活体信息终端。他们常年在外,跑订货会、跑主管部门、跑用户单位,随身带着产品样本和介绍信,靠腿、靠嘴、靠关系把供需接起来。一家企业的市场半径,几乎等于它的供销员们跑过的地图。

从信息机制的角度看,供销员是熟人网络在新条件下的重建——第一部讲过的那套「认脸」机制,以企业雇员的形式回来了。它有效,但极其昂贵:养一支供销队伍的成本、差旅的成本、以及信息只存在于个人脑子里带来的风险(供销员跳槽,客户关系跟着走)。

整个名录时代的商业信息服务,本质上都是在回答同一个问题:能不能用更便宜的方式,替代一部分供销员的腿?

二十二、1980 年代的过渡形态

1980 年代的工厂信息服务,是几种过渡形态的混合体。

订货会转型了。 全国机电产品展销订货会改变方式,开放市场,优质和名牌产品成交额高。订货会从计划机制变成了市场机制——过去在会上执行计划,现在在会上竞争订单。1980 年长沙那次订货会上,武汉一个市的机械系统成交 2 亿余元,正是这个转型期的写照。

行业媒体出现了。 各工业部门的机关报刊逐步增加产品信息、供求信息的版面,「供求信息」栏目成为许多行业报纸最受欢迎的部分。企业花钱在上面登一条「本厂常年供应××型号××产品」,就可能收到全国各地的来信。

名录出版业起步了。 各种《企业名录》《厂商名录》《产品目录》开始由出版社、行业协会、信息咨询机构编纂发行。这类出版物的信息来源,很大程度上依托前一个时代留下的主管部门台账——这是目录时代那份遗产的第一次市场化变现。

电报和信件承担了确认环节。 在电话不普及的年代,企业之间的商务联系大量依靠信函,「函购」「函索样本」是那个年代商业广告的标准用语。

这些过渡形态有一个共同特征:信息极度稀缺,以至于任何一条信息都有人认真对待。 一条几十个字的供求信息可以带来几十封回信;一本名录哪怕错漏百出,也会被翻到卷边。

稀缺决定了那个年代信息服务的商业逻辑:做出来就有人要,关键是做得出来。 竞争的重点在采集端——谁能把信息收集起来、印出来,谁就赢。质量、更新、口径这些今天的核心问题,在当时都是奢侈的讲究。

这个逻辑在信息从稀缺走向过剩的过程中会彻底反转。到本文第五部,竞争的重点将从「有没有」变成「准不准」;到第六部,变成「能不能被机器直接用」。

二十三、供销员的名片盒

前一章提到供销员是「企业派出去的活体信息终端」。这个说法还需要补一层:供销员采集回来的信息,存在哪里?

答案是:存在供销员自己身上。

1980 年代到 1990 年代的绝大多数企业,没有客户档案制度。供销员跑出来的客户关系,记录在他自己的名片盒、笔记本、通讯录里,更多的是记在脑子里——谁是采购科长,谁说了算,谁喜欢什么,上次报的什么价,下次该什么时候去。这些信息从来没有被要求录入企业的任何系统,因为企业没有系统。

这带来一个在当时被视为理所当然、今天看来极其昂贵的后果:客户信息是供销员的个人资产,不是企业的资产。

供销员跳槽,客户跟着走——这不是道德问题,是信息结构问题。企业只知道自己有一批客户,不知道这批客户的联系人是谁、怎么联系、关系深浅。等到供销员离开,企业手里只剩下一堆过期的发货单。

少数企业尝试过用「客户登记卡」把信息制度化——供销员回来要填卡片,记录客户名称、联系人、电话、拜访情况。执行效果普遍不好,原因很直接:填卡对供销员没有好处,只有坏处。 信息写清楚了,自己就可以被替代。这是本系列第一篇文章讨论的「填报的动机与真实性天然冲突」在企业内部的版本。

这段历史,是理解「联系人」这个字段在中国为什么如此难以公共化的一把钥匙。

在本系列第一篇文章的八个字段里,「谁能拍板、怎么联系」被列为最难的一格。难在可得性、准确性、合规性三层。而历史提供了第四层解释:这一格的信息,从一开始就是以个人资产而不是企业资产的形态存在的。 它散落在无数个名片盒和通讯录里,从未进入过任何公共的、可查询的载体。

平台时代的企业档案里有「联系方式」一栏,填的多是总机或者销售部的公用电话;公示系统里有企业联系电话,填的是登记时留的号码,很多是代办机构的。真正有效的决策人直线,从 1980 年代的名片盒,到 2020 年代的微信通讯录,始终在个人手里。

要把这一格做成公共可用的数据,只能走一条路:从决策人自己在公开场合留下的痕迹里提取——招投标文件的项目联系人、展会名录的商务联系方式、行业协会的会员通讯录、企业官网的联系页面——然后核验、脱敏、按权限提供。这条路的成本,比抓取工商登记高一个数量级;而它的合规要求,又比其他任何字段都严格。

名片盒的年代,一个供销员离职,企业丢失的是几十个客户的联系方式。今天,一份包含几百万决策人联系方式的数据库如果没有脱敏与权限机制,丢失的将是整个数据品类的合法性。本系列第一篇文章把合规投入称为「期权」——它买的是继续经营的权利。这个判断,在名片盒的历史里已经有了雏形:联系人信息的价值,永远与它的保护程度成正比。

二十四、从 0.43 到 19.1:联系方式的前提

本系列第一篇文章把「谁能拍板、怎么联系上」列为工厂数据八个字段里最有商业价值的一格。这一格有一个常被忽略的物理前提:对方得有电话。

而在名录时代开始的时候,中国绝大多数工厂没有电话。

1980 年,中国的电话普及率为每百人 0.43 部——平均每一百个人拥有不到半部电话,是当时世界平均普及率的十分之一,也只有非洲平均水平的三分之一。普及率低的根源在交换机:机电式交换机容量有限,扩容极慢,装一部电话要排队等待,等待期以年计。

引进程控交换技术之后,情况开始改变。到 1990 年,普及率提高到每百人 1.11 部;从 1993 年起,每年的增幅都超过每百人 1 部;到 2000 年,达到每百人 19.1 部——超过了世界上绝大多数发展中国家。2000 年之后加速更快,到 2012 年,含移动电话的普及率首次超过每百人 100 部,达到 103.1 部。

但 2000 年的 19.1 是一个全国平均数,掩盖了巨大的落差:城市固定电话普及率达每百人 38.5 部,农村仅为 8.2 部,东部沿海地区与中西部地区的普及率差距超过五倍。

把这条曲线与本部前面几章对照,会看清一些此前不容易解释的现象。

为什么 1980 年代的供销员要靠腿跑? 因为打不了电话。一家 1985 年的乡镇企业,多半没有自己的电话;即便有,对方也多半没有。电话联系需要双方都有话机,而在普及率 1% 的年代,两家企业同时有电话的概率是百分之一的量级。供销员的差旅费,就是那个年代的通信费。

为什么 114 查号台到 1982 年才「全面接入社会」? 因为在此之前,可查的号码太少,查号服务没有面向全社会开放的意义。

为什么早期的商业名录记录的是地址而不是电话? 因为大部分被收录的商号没有电话可记。1944 年《上海行名录》附录「百业人士住址」——是住址,不是电话。

为什么「联系方式」这个字段的历史这么短? 因为对绝大多数中国工厂来说,可被记录的联系方式在 1990 年代之前根本不存在。以全国普及率超过每百人 10 部作为大致分界,「大部分工厂有电话可查」这件事,出现在 1997 年前后。这个字段的历史只有不到三十年。

三十年里它又经历了三次形态迁移:固定电话(1990 年代)、传真与固话并存(2000 年代)、手机为主(2010 年代之后)。每一次迁移都让上一代的记录整体失效——一本 2005 年的名录里的固话号码,到 2015 年大部分已经无人接听,因为决策人的联系方式已经迁到了手机上。

固定电话用户在 2000 年代中期达到峰值之后持续下降,到 2015 年,固定电话普及率降到每百人 16.3 部,而移动电话普及率升到每百人 95.5 部。企业的「联系方式」从一个挂在单位上的号码,变成了挂在具体的人身上的号码——这个变化把「找企业」和「找人」两件事合并了,也把个人信息保护的问题带进了产业数据领域。

本系列第一篇文章讨论联系方式时说,它是「所有字段里失效最快的」。从历史看,它不仅失效最快,而且每隔十年就整体换一次载体。一个 1995 年开始积累联系方式的数据库,如果不持续更新,到今天几乎是一张废纸;而一个能保持有效的数据库,它的价值不在于存量,而在于跟上了三次载体迁移。

电话普及率的曲线,是理解中国工厂数据「为什么以前没有、现在有了、以后还会变」的最基础的一条曲线。

二十五、1985:35.8 万家

1983 年 11 月,国务院发出通知,决定进行第二次全国工业普查。普查以 1985 年为标准时点,共调查了 35.8 万个乡以上独立核算工业企业,取得了当时中国历史上最为完整、最为系统、最为详尽的工业信息。

35.8 万。请记住这个数字,十年之后它会变成 734.2 万。

先看口径。「乡以上独立核算工业企业」——这个限定词划掉了两大类主体:村及村以下的集体与个体工业,以及非独立核算的生产单位。1985 年正是乡镇企业开始爆发的年代,被划掉的那部分,恰恰是增长最快的那部分。

这不是普查设计的失误,而是延续了目录时代的管理视野:国家工业管理体系的触角到乡为止,村以下的生产活动在管理意义上属于农村副业,不在「工业」的账上。

但市场不管这套账。1980 年代的采购者已经发现,很多东西在国营大厂买不到或者要等很久,而某个乡镇的社队企业转型来的小厂能做、便宜、交货快。这些厂在普查里不存在,在产品目录里不存在,在主管部门的台账里也不存在——但它们真实地在生产,真实地在接单。

统计体系与市场现实之间,从这个时候开始出现一条系统性的裂缝。 裂缝里的主体数量,在此后十年间以惊人的速度增长。

这次普查还有一层意义常被忽略:它是计划时代那份内部台账的第一次全面盘点。1983 年 11 月国务院发出通知,普查于 1986 年第一季度进行,以 1985 年为标准时点。此时距离 1979 年流通体制改革不过六年,大量国营与集体工业企业刚刚开始自主销售,主管部门的台账仍然是最完整的主体底册。普查员拿着这份底册逐一上门核对,得到的 35.8 万家,实际上是计划体系遗产在市场条件下的第一次校准——哪些企业还在、哪些已经停产、哪些改了名、哪些分立了。

正因为有这份底册,1985 年的普查在覆盖率上相当可靠——对乡以上企业而言。也正因为底册只到乡一级,普查在边界之外的盲区同样清晰。一份普查的质量,从来由它的底册决定。

二十六、普查员:35.8 万是怎么数出来的

上一章的 35.8 万,是一个人工数出来的数字。值得停下来看一看,这个数字是怎么产生的——因为普查方法本身,是理解「完整性的成本」最好的样本。

一次全国性普查的流程,大致有六步。

第一步,确定标准时点。 所有数据都以某一个时刻为准——经济普查制度化之后,固定为普查年份的 12 月 31 日。这一步看似形式,实际上解决了产业数据里最基础的一个问题:如果不冻结时点,数字就无法汇总。 一家企业在一月有 300 人、十二月有 80 人,不定时点就没有「这家企业有多少人」这个问题的答案。

第二步,编制单位清查底册。 普查之前先要有一份「应该被普查的对象」的清单,来源是登记部门、税务部门、统计部门各自掌握的单位名录,合并去重之后形成底册。底册的完整程度,直接决定了普查的覆盖率——底册上没有的单位,普查员不会去。1985 年那次以「乡以上独立核算」为界,底册就只到这一层;1995 年扩大到全部工业企业,底册要重新编。

第三步,普查员逐单位登记。 普查员拿着表格上门,逐项询问、填写、核对。这是整个流程里成本最高的环节——它是纯粹的人力,无法并行加速,每个单位都要有人去一次。

第四步,逐级审核汇总。 基层填报的表格逐级上报,每一级做逻辑审核(数字是否自洽、与上期是否合理)之后汇总。

第五步,事后质量抽查。 普查结束后抽取样本重新调查,与普查结果比对,计算差错率。第五次全国经济普查的事后质量抽查结果表明,普查数据填报综合差错率为 4.7‰——千分之四点七。

第六步,发布与封存。 汇总数据以公报形式发布;单个单位的普查资料依法只用于统计目的,不对外提供查询。

六步走完,一次普查通常要跨两个年度,动员的普查人员以百万计。这就是为什么经济普查五年才做一次——全量人工核验的成本,决定了它的频率。

把普查方法与商业数据的加工方法放在一起,可以看到两者在一个根本取舍上走了相反的方向:

  • 普查追求完整性,用固定时点、全量上门、逐级审核来保证每一个单位都被数到、数准,代价是时效——五年一次,发布时数据已经过时一年多;
  • 商业数据追求时效性,用持续采集、多源信号、自动更新来保证信息尽量新,代价是完整性——永远有采不到的主体、核不实的字段。

这两者不是竞争关系,而是互补关系。普查提供的是校准基准:一家商业数据库如果宣称覆盖了全国的制造业主体,最直接的检验方法就是拿它与最近一次普查的分行业、分地区法人单位数做对照——如果某个省某个行业的数量差了一倍,问题一定出在某一边。本系列第一篇文章把「抽样估计覆盖率」列为唯一可信的方法,而普查公报正是最好的抽样参照。

普查方法还揭示了一件事:4.7‰ 的差错率,是用极高的成本换来的。 全量上门、逐级审核、事后抽查,三道关卡才把差错压到千分之几。任何一家商业机构,如果宣称自己的数据「准确率 99% 以上」而拿不出对应的核验流程,这个数字就应当被打上问号。准确率不是宣称出来的,是用流程和成本堆出来的。

1985 年的 35.8 万,就是这样一家一家数出来的。它之所以值得信任,不是因为它是官方数字,而是因为它背后有一套可以被复核的方法。

二十七、乡镇企业:统计视野之外的产能

上一章留下的那个二十倍的缺口——1985 年的 35.8 万与 1995 年的 734.2 万——大部分可以用四个字解释:乡镇企业。

先看数字。1978 年,全国乡镇企业约 152 万个,从业人员 2826 万人,总产值 493 亿元。到 1987 年,乡镇企业中二、三产业产值合计增加到 4854 亿元,相当于当年农业总产值的 104%,首次超过了农业总产值——这一年被视为乡镇企业发展的第一个「黄金时期」。1993 年,乡镇企业从业人员超过 1 亿人,总产值突破 3 万亿元。到 1996 年,乡镇企业数量达到 2336 万个,吸纳就业 1.35 亿人,增加值占国内生产总值的比重从不足 6% 攀升至接近 30%。1998 年,乡镇企业实现增加值 22186 亿元,占国内生产总值的 27.9%,上交国家税金 1583 亿元,占全国税收总额的 20.4%。

出口方面同样惊人:到 1990 年,乡镇企业中出口创汇的企业已达 5.6 万家,出口产品外贸收购总额 485 亿元,比 1985 年增长十倍,占全国出口产品收购总额的四分之一;到 1995 年,出口创汇企业发展到 12 万家,出口交货值 5395 亿元;1998 年,乡镇企业出口产品交货值 6854 亿元,占全国出口的 34.8%。

十八年间,从 152 万个到 2336 万个,从不足 6% 到接近 30%。这场增长在当时被形容为「异军突起」。

在本文的坐标系里,乡镇企业的意义需要从两个方向看。

从统计的方向看,它是「视野之外的产能」的最大来源。

1985 年第二次工业普查的口径是「乡以上独立核算工业企业」,而乡镇企业中的村办、联户办、户办企业不在其中——恰恰是增长最快的部分。等到 1995 年第三次工业普查把「全部工业企业」纳入,数字直接翻了二十倍。

这不是普查的失误,而是管理视野与市场现实之间的时滞。计划体系的触角到乡为止,村以下的生产活动在管理意义上是农村副业;但市场不管这套账,村办厂接单、生产、出口,一样都不少。统计追上现实用了十年。

本系列第一篇文章讨论「中国有多少家工厂」时,指出登记为个体工商户的加工主体不进入制造业企业统计。乡镇企业的历史说明,这条统计边界从一开始就存在,而且边界之外的部分从来不小。

从信息的方向看,乡镇企业是名录时代信息服务的最大需求方和最大供给方。

需求方,因为它们没有主管部门的产品目录、不在国营流通体系里、没有调拨渠道——它们必须自己找市场。1980 年代那支庞大的供销员队伍,很大一部分来自乡镇企业。它们是行业报刊供求信息栏目最踊跃的刊登者,是订货会上最积极的新面孔,也是后来慧聪商情、中国黄页、阿里巴巴最早的付费用户群。

供给方,因为它们的产能是名录最需要收录、也最难收录的部分。它们分散在几十万个村镇里,没有统一的行业归口,名称随意(「××村五金厂」「××乡机械配件厂」),变更频繁,很多连固定电话都没有。任何一本名录想收全它们,采集成本都是天文数字。

于是名录时代出现了一个结构性的错位:最需要被找到的企业,恰恰最难被收录。

这个错位一直延续到今天。乡镇企业经过三十年的分化,一部分成长为大型民营制造集团,一部分转为规范的有限责任公司,还有相当一部分以个体工商户或小微企业的形态继续存在于各个产业带里——诸暨的袜厂、永康的五金作坊、南康的家具厂。它们是本系列第一篇文章讨论的「480 万家工厂」口径与「246 万家制造业企业」口径之间差异的主要来源,也是产业数据加工中覆盖成本最高的那一层。

1985 年普查没数到的那些厂,2026 年仍然是最难数清的那些厂。

二十八、1992:一辆自行车

1992 年 10 月,北京中关村,一家叫慧聪的公关信息咨询公司成立。创办人郭凡生的启动资金是 7.4 万元。

它的第一个产品,是一本油印的小册子——《慧聪商情广告》。做法是:员工骑着自行车,每天穿梭于中关村的写字楼和大街小巷,从中关村跑到前门大栅栏,把家电、计算机经销商的报价信息一家一家收集起来,分类加工处理,油印成册,面向市场发行。

几乎每一个新进慧聪的员工,都会在培训课上看到一张照片:一栋二层老式房子前,七八个青年男女骑着老式自行车匆匆离开,各奔东西。

创业极其艰难。当时市场对「信息」这种商品的接受度很低——你不生产东西,凭信息就想赚钱?但商情切中了真实需求:在价格不透明的市场里,一本汇集了各家报价的册子,让买卖双方第一次可以横向比较。在竞争透明化的压力之下,越来越多的商家接受了商情的方式,慧聪很快成为中关村最大的商情信息提供商,第一年收入超过 100 万元。

到 1997 年,慧聪已经发展成为三十个行业提供商情和黄页的商情服务公司。后来有数百万人靠着慧聪商情杂志做生意。

慧聪商情在中国工商信息史上的位置,值得认真评价。

它是第一个证明了「信息本身可以作为商品规模化销售」的本土案例。 此前的名录出版是出版业的副业,行业报刊的供求信息是媒体的栏目,而慧聪把「采集—加工—发行」做成了主业,并且盈利。

它的采集方式定义了这个行业的成本结构。 骑自行车一家一家跑——信息采集是劳动密集型的,覆盖范围与投入人力成正比。这个成本结构决定了商情必须聚焦高密度区域(中关村)和高价值品类(家电、计算机),无法快速扩张到低密度地区。

它的更新频率是周期性的。 商情按期出版,报价信息在两期之间会过期。在价格波动剧烈的年代,这个时滞是产品的核心缺陷,也是用户每期都买的原因——旧的没用了。

采集靠人力、覆盖看密度、更新按周期。这三个特征,是纸质信息服务的天花板,也是后来互联网平台的突破口。

二十九、1995:中国黄页

1995 年,马云在杭州创办「中国黄页」,把中国企业的信息做成网页放到互联网上。

多年以后,在与慧聪的竞争中,马云曾在一份声明里这样评价对手:「现在已经过了骑着自行车满大街兜售商情的时代。」

这句话用来做本部与下一部的分界线,再合适不过。但在 1995 年当时,中国黄页做的事情其实和慧聪没有本质区别——采集企业信息、加工、发布,只不过载体从纸换成了网页。而且它面临一个更尴尬的处境:它把企业信息放上了互联网,而它的目标客户——中国企业——绝大多数还没有见过互联网。

中国黄页的具体业务是向企业销售「上网」服务:给企业做一个网页,放到网上,让全世界看到。销售的最大障碍是演示——在没有普及拨号上网的城市里,销售人员甚至无法当场让客户看到自己的网页长什么样。

这段历史通常被当作马云创业故事的序章来讲。在本文的语境里,它的意义是另一个:中国企业信息的互联网化,是由「让外国人找到中国工厂」这个外向需求启动的,而不是由内贸需求启动的。

逻辑很直接:1995 年,中国境内的潜在买家不上网,境外的潜在买家上网。把中国企业信息放上互联网,唯一现实的读者是海外采购商。所以早期的企业上网服务,本质上是出口导向的——这条基因深刻影响了此后十年 B2B 平台的形态:先做外贸,后做内贸;先服务出口企业,后服务内贸企业。

第四部要讲的阿里巴巴,正是沿着这条基因长出来的。

三十、1995:734.2 万个

同一年,另一件重要得多、但知名度低得多的事情发生了:第三次全国工业普查。

这次普查与 1985 年那次有一个决定性区别:普查对象是全部工业企业——不再限于「乡以上独立核算」。村及村以下的工业、个体工业,全部纳入。

普查结果于 1997 年 2 月发布:1995 年末,全国工业企业和工业生产单位 734.2 万个,从业人员 14735.5 万人,资产总额 77231.2 亿元。

十年前,35.8 万;十年后,734.2 万。

两个数字相差二十倍。这二十倍里,一部分是真实的增长——乡镇企业在这十年里爆炸式扩张;但更大的一部分是口径的展开——1985 年被划在统计边界之外的那些主体,1995 年被数进来了。

734.2 万这个数字,今天看依然震撼。作为对照:2023 年末,第五次全国经济普查口径下的制造业法人单位是 404.9 万个;按统一社会信用代码口径,2025 年 5 月末制造业企业总数是 246 万家。

1995 年的 734.2 万与今天的 404.9 万之间,同样不可直接比较——前者统计的是「工业企业和工业生产单位」,含采矿、电力,且以生产单位计数;后者统计的是制造业法人单位。但两组数字放在一起至少说明一件事:中国工业主体的数量规模,在三十年前就已经是数百万量级。

而 1995 年的信息服务能力是什么水平?慧聪的商情覆盖三十个行业的主要城市,中国黄页刚刚起步,114 只能按名字查号码,名录出版物的收录量以万计。

数百万量级的主体,万量级的收录能力。 这就是名录时代结束时,信息基础设施与现实之间的缺口——三个数量级。

这个缺口不是谁的失职,它是纸质媒介的物理极限。一本收录 734 万家企业、每家哪怕只占三行的名录,厚度会超过两万页——那不是一本书,是一面墙。而且印出来的那一刻,里面已经有几十万家发生了变更。

纸走到头了。

三十一、纸的极限:一份清单

在进入平台时代之前,值得把纸质信息服务的极限系统地列一遍——因为后来每一代技术,都是在逐条突破这份清单。

极限一:容量。 纸的信息密度有物理上限。数百万主体、数十个字段、持续更新,印刷媒介在容量上差三个数量级。

极限二:检索。 纸质名录只能按一个维度排序——按行业、按地区、或按笔画。想按「行业×地区×规模」组合查询,纸做不到。使用者只能按最粗的维度翻到大致区域,再逐条人工扫描。

极限三:更新。 出版周期以月或年计,而企业信息以天为单位变化。名录越厚,修订成本越高,更新越慢——容量与新鲜度在纸上是互相冲突的。

极限四:分发。 一本厚重的名录,印刷、仓储、运输的成本都随份数线性增长。信息本身的边际成本趋近于零,但纸质载体让它的分发成本降不下来。

极限五:反馈。 出版者不知道读者查了什么、找到了没有、名录里哪条信息是错的。纸是单向的,错误没有回路可以修正。

这五条极限,决定了纸质时代信息服务的形态天花板:粗粒度、低频更新、单维检索、区域覆盖、无质量反馈。

互联网在 1999 年之后逐条解决了前四条——容量近乎无限、多维检索、实时更新、零成本分发。

但第五条只解决了一半。用户的查询行为可以被记录了,可信息错误的反馈回路,至今仍然是整个行业最薄弱的环节:用户发现一条联系方式失效,通常只会默默换一条路,很少会告诉数据提供方。本系列第一篇文章讨论的「静默失效」问题,从纸质时代一路延续到了今天。

技术换了三代,第五条极限还站在原地。这提示我们它可能根本不是技术问题——它是激励问题:使用者没有义务、也没有动力替提供者纠错。 谁的数据,谁负责核验,这件事从来外包不出去。

第四部 平台的时代(1999—2013)

三十二、1998:南京的另一条起跑线

讲中国 B2B 的历史,人们习惯从杭州讲起。但按时间排,南京在前面。

焦点科技的前身南京焦点科技开发有限公司成立于 1996 年 1 月。由它自主开发的中国制造网(Made-in-China.com)电子商务平台,自 1998 年 2 月开始运营——比阿里巴巴的创立早了一年多。

中国制造网的定位从名字里就能读出来:Made-in-China,把中国制造的供应商展示给全球采购商。它的宗旨表述是「弘扬中国制造、服务中小企业、促进全球贸易」,业务模式是向中国供应商收取会员服务费,向海外买家免费开放检索。

这个模式的信息结构值得拆开看。平台上的每一个供应商页面,本质上是一份标准化的企业档案:公司介绍、产品目录、图片、认证、联系方式。买家按产品关键词或类目检索,命中供应商,发出询盘。

与上一部讲的纸质名录相比,它逐条突破了纸的极限:容量不受限、可以按产品和地区组合检索、随时可以更新、对全球零成本分发。1990 年代末困住整个行业的四条物理极限,一个网站全部解决。

焦点科技此后的轨迹印证了这个模式的生命力:2007 年 9 月整体变更为股份有限公司,后在深交所上市(证券代码 002315);到 2012 年底,中国制造网注册会员超过 800 万,仅 2012 年就有来自超过 240 个国家和地区的用户访问,访问量超过 5.5 亿人次。

但有一条极限,网站不仅没有解决,反而以新的形式固化了下来——这条线索先按下,讲完阿里巴巴一起说。

三十三、1997:杭州的化工网

在综合平台之外,平台时代还有一条被讲得少得多的路线:垂直行业网站。它的起点比中国制造网和阿里巴巴都早。

1997 年 11 月,沈阳工业大学计算机专业毕业的孙德良从国内早期网络公司「讯业」辞职创业,开通了国内第一个专业化的垂直化工网站,也就是中国化工网最早的版本。此后它长期被称为国内第一家专业化工网站,在客户量、数据量和访问量上都居于同类网站前列。

垂直网站与综合平台的差别,在信息结构上是根本性的。

综合平台以「品类目录」组织信息,深度到产品名称为止;垂直网站以「行业知识」组织信息,深度可以到规格、牌号、纯度、包装、价格行情、上下游关系。一个化工采购员在综合平台上搜「硫酸」,得到的是几千家供应商的列表;在化工网上搜「硫酸」,得到的可能是分浓度、分等级、分产地的报价、库存与走势。

垂直路线用信息深度换覆盖广度。 它的编辑团队懂行业,能把行业黑话翻译成标准表述,能判断哪些企业是真正的生产商、哪些只是贸易商——这个判断在化工行业尤其重要,因为化工品的贸易层级极多。

垂直路线的问题是天花板。一个行业的企业数量有限,会员费收入有上限;行业景气周期直接决定网站收入;要扩张只能进入新行业,而新行业需要重新组建懂行的团队。

孙德良给出的解法是联盟。2005 年 11 月 3 日,「行业网站联盟」宣布成立,这是后来「生意宝」的前身。2007 年,网盛斥资打造联盟网站生意宝,先后推出「行业网址导航」「B2B 网站点击排行榜」,并购中国服装网,参股中国机械专家网,开通中国卫浴网,同年获得「最佳商业模式奖」,提出「小门户+联盟」模式。联盟最终以生意宝为中心站,聚合了数以千计的行业网站,辐射千万级会员。

「小门户+联盟」在本文的坐标系里是一个有意思的尝试:它试图用几百个垂直切片拼出一幅全景。 每个切片的深度由懂行的人保证,全景的广度由联盟保证。

这个思路的逻辑是对的,但执行难度极高——几百个独立运营的网站,数据格式各异、口径各异、更新节奏各异,「联盟」在流量上可以互通,在数据上很难真正打通。它没有成为一个统一的数据底座,而是停留在一个流量与导航的层面。

不过,这段历史留下了一条至今有效的判断:产业信息的可信度,与加工者对行业的理解深度正相关。 一个不懂化工的编辑,分不清生产商和贸易商;一个不懂机械的算法,分不清「加工中心」是设备名称还是企业类型。本系列第一篇文章讨论大模型进入加工链路时强调「模型不能替代口径定义」,而口径定义的背后,是行业知识——这正是垂直网站在 1997 年就已经证明的事情。

综合平台后来也意识到了这一点,纷纷设立行业频道、行业运营团队;查询工具在 2020 年代也开始按行业做细分产品。垂直与综合的分野,最终在「按行业组织的通用底座」这个方向上汇合。

三十四、1999:十八个人的判断

1999 年,马云和另外十七个人在杭州创办阿里巴巴。

这个故事被讲过太多次,本文只取与主题相关的那一层:阿里巴巴的起点判断,是一个关于信息的判断。

马云在 1995 年做中国黄页时积累的认知是:中国有大量中小工厂能生产质量不错的商品,海外有大量中小买家想绕过大贸易商直接采购,两边都找不到对方。大企业有广交会、有外贸公司、有驻外机构,中小企业什么都没有。

阿里巴巴早期的产品形态因此非常朴素:一个供求信息发布板。中国供应商发布「我能供应什么」,海外买家发布「我要采购什么」,平台做的事情是分类、展示、撮合。

它与慧聪商情的差别,不在信息的性质——都是供求信息——而在三个维度:

其一,覆盖的地理范围。 商情靠自行车采集,覆盖一个城市的一个行业聚集区;网站靠企业自主提交,理论上覆盖全国乃至全球。采集模式从「跑出去收」变成了「等着企业来填」,成本结构发生了根本变化。

其二,信息的方向。 商情是单向发布的报价册;平台是双向的——买家的询盘本身也是信息,而且是卖家愿意付钱看到的信息。

其三,时效。 商情按期出版,平台实时更新。

1999 年到 2001 年,阿里巴巴迅速积累起海量的注册会员。接下来的问题是:怎么收钱。

三十五、中国供应商:卖的不是信息,是排名和信任

阿里巴巴的第一个成规模的收费产品,是面向出口企业的「中国供应商」(China Supplier)会员服务:付费会员获得独立的企业展示页面、产品展示位、优先的搜索排序,以及平台的审核背书。

请注意这个产品卖的是什么。它不卖信息访问权——买家检索是免费的;它卖的是被看见的优先权和可信度的背书。

这个设计精确地对应了当时的信息格局:供应商信息已经不稀缺了——平台上有几十万家企业,买家的问题从「找不到」变成了「不知道信哪家」。于是商业模式从信息销售转向了注意力分配与信任分配。

这是中国工商信息史上的一个重要拐点,值得停下来标记:大约从 2000 年代初开始,工厂信息的瓶颈从数量转向了质量。 上一部结尾那个「三个数量级的缺口」,在数量维度上被互联网快速填平,随即在质量维度上重新裂开。

「中国供应商」的会员费定价在数万元一年的量级,对 2000 年代初的中小企业是一笔重的投入。企业愿意付,是因为算得过账:一个海外订单的利润就能覆盖全年会员费。出口的高毛利,支撑了 B2B 平台的第一桶金。

这也解释了为什么中国的 B2B 平台清一色从外贸起家——不是内贸不需要信息服务,而是内贸的单笔利润薄,撑不起同样的会员费。信息服务的定价能力,取决于它所服务的交易的利润率。这条规律至今有效。

三十六、2002:诚信通——信用的第一次产品化

2001 年 8 月,阿里巴巴为国际站卖家推出「诚信通」会员服务;2002 年 3 月,面向从事国内贸易的买卖双方,中国站「诚信通」计划启动。

诚信通做的事情,用今天的语言描述就是:把分散的信用信号聚合成一个可展示的产品。 它通过五个方面审核申请商家的诚信状况——第三方认证、证书及荣誉、阿里巴巴活动记录、资信参考人、会员评价——并把结果做成档案展示在商家页面上。ISO 体系等行业认证也成为重要参考要素,诚信记录良好的用户会获得优先排名、平台推荐等奖励。

价格定得很低:企业会员每年 2800 元,个人会员每年 2300 元。与「中国供应商」的数万元相比,这是一个下沉产品——让内贸中小商家也付得起。

效果数据相当可观:诚信通会员的成交率从 47% 提高到 72%;调查统计显示,85% 的买家和 92% 的卖家会优先考虑与诚信通会员合作,诚信通会员的成交率是普通会员的 7 倍。

在本文的坐标系里,诚信通是一个标志性事件:中国市场上第一次有人把「这家企业可不可信」做成了标准化、可购买、可展示的产品,并且以百万量级的规模卖了出去。

第一部讲过,传统的信任生产靠熟人担保;第二部讲过,广交会用组织信誉替代主体信息。诚信通是第三种形态:平台用一套审核流程批量生产信任凭证。

但要看清它的边界。诚信通验证的核心是身份与记录——工商注册是真的、证书是真的、在平台上的交易行为有记录。它没有验证、也无法验证生产能力——这家企业是不是真有工厂、产能多大、工艺水平如何。

身份可信与能力可信,是两件事。前者可以靠流程批量解决,后者在当时没有任何低成本的验证手段。这个未被解决的部分,就是本系列第一篇文章里那个判断的历史根源:某查类工具与交易平台都「分辨不出哪家公司到底是不是工厂」。

三十七、验厂:用人补数据

诚信通解决了「身份可信」,没有解决「能力可信」。这个空白在 2000 年代由另一种服务填补:验厂。

验厂——工厂审核——的做法是:买方(通常是海外品牌商或零售商)委托第三方审核机构,派审核员到工厂现场,按照一套清单核实资质文件、生产设备、产能状况、质量管理体系、劳工与安全条件,形成一份审核报告。买方根据报告决定是否下单。

这项服务在 2000 年代随着中国出口的爆发而快速扩张。海外买家面对的处境是:平台上有几十万家「工厂」,其中相当比例是贸易商;诚信通验证了对方是一家真实注册的企业,但验证不了它有没有车间;样品可以是别人做的,图片可以是别人的车间。在数据无法回答「能不能做」的时候,唯一的办法是派人去看。

验厂的信息价值很高。一份合格的审核报告,能回答本系列第一篇文章八个字段里最难的几格:真实生产地址、实际设备清单、实际用工规模、产品与工艺的实际能力、体系认证的真实性。这些恰恰是任何公开数据源都拿不到的信息。

但验厂作为一种信息生产方式,有四个内在的限制:

第一,单次。 一次验厂对应一个时点,报告出具之日起就开始过期。工厂换了设备、减了产线、搬了厂区,报告不会自动更新。

第二,昂贵。 一次验厂的费用在数千元到数万元量级,加上审核员差旅。对一个大额订单来说值得,对筛选阶段的几十个候选来说不可能每家都验。

第三,不可复用。 报告归委托方所有,通常不对外共享。同一家工厂可能在一年里被五个不同的买家验了五次,五份报告互不相通。信息被反复生产、反复付费,社会总成本极高。

第四,不可检索。 验厂报告是针对已经选定的工厂做的确认,它无法帮助买家「发现」工厂——你得先知道要验谁。

这四个限制合起来,说明验厂解决的是确认环节,而不是候选环节。本文第一部讲过「候选靠信息,确认靠关系」,验厂是「确认靠关系」的现代化版本——把熟人的背书换成了审核员的签字。

从整个信息体系的角度看,验厂的存在本身是一个信号:它说明数据体系在「能力」这个维度上有多大的空白。 一个成熟的产业数据体系,应该能把验厂报告里的大部分内容——设备、产能、工艺、认证——在候选阶段就提供出来,让验厂回归它本来的角色:对最终少数几家的实地确认。

这个方向在接口时代开始变得可能:从招聘信息里读设备类型、从中标记录里读交付能力、从资质公示里读认证状态、从专利里读工艺方向。这些信号加起来,虽然达不到一份实地审核报告的精度,但足以把候选池从几十家压缩到几家,让验厂的钱花在刀刃上。

验厂不会消失。但它服务的范围,正在被数据从两头压缩。

三十八、2003:从刊到网的惊险一跃

2003 年 12 月 17 日,慧聪在香港上市。2004 年,慧聪从以刊为主向以网为主实现过渡。

从纸质商情到互联网平台,慧聪完成了媒介的迁移,并且在此后多年保持了可观的业绩——上市后曾连续六年利润增长超过 100%。以刊物时代积累的行业深度(三十个行业的商情网络)为基础,慧聪网在工业品、机电、化工等垂直领域长期占有一席之地。

但从更长的时间看,先行者的包袱同样明显。商情时代的资产是行业编辑部、地面销售队伍、按行业分册的信息组织方式;互联网时代的核心竞争力是流量运营、产品迭代、算法排序。前者向后者的转化率并不高。

郭凡生本人在 2000 年代中期说过一句今天读来仍有分量的话:如果慧聪和阿里巴巴在 B2B 的统治地位受到挑战,甚至被打破了,那对中国是一件好事——「我现在看到的是慧聪和阿里巴巴太大,没人敢挑战。」

把这句话放进本文的坐标系:2000 年代中期的中国 B2B 信息市场,已经形成了平台双寡头格局。而寡头格局下的工厂信息,呈现出一个此前从未有过的特征——信息的组织方式由平台的商业模式决定,而不是由信息本身的完整性决定。

这就要回到前面按下的那条线索了。

三十九、会员制的内在限制

平台时代解决了纸的四条极限,却新造了一条自己的极限:收录边界由付费意愿划定。

逻辑链条很短:平台的收入来自供应商会员费;平台的运营资源(审核、展示、流量)向付费会员倾斜;免费企业的信息质量无人维护,逐渐沦为「僵尸页面」;久而久之,平台上「活着」的信息,只覆盖愿意付费做线上推广的那部分企业。

哪些企业愿意付费?做外贸的、做批发的、产品标准化程度高的、依赖增量客户的。

哪些企业不付费?给固定大客户做配套的、订单排满不愁销路的、产品高度定制的、老板不信线上的。

问题在于,第二类企业里恰恰藏着中国制造业相当大的一部分优质产能——它们不需要被陌生买家找到,所以从不出现在平台上。一家给国际品牌做了十五年精密结构件的工厂,可能在任何 B2B 平台上都查无此厂。

于是平台时代的工厂信息版图出现了系统性的偏斜:线上可见度与线下制造能力,负相关的情况屡见不鲜。 越是营销驱动的企业越显眼,越是制造驱动的企业越隐身。海外买家按平台信息筛选中国供应商,筛出来的常常是贸易商——贸易商最有动力付费获客。

本系列第一篇文章把「店铺主体与生产主体不一致」列为 B2B 平台数据的系统性偏差。这个偏差不是数据处理的疏漏,而是会员制商业模式的必然产物——平台收录的从来不是「中国的工厂」,而是「愿意在平台上花钱的企业」。 两者的交集远小于任何一方。

这条极限无法在平台模式内部解决,因为解决它意味着平台要花钱去维护不付费企业的信息——商业上不成立。它要等到下一个时代,由公共部门用另一种逻辑来破。

四十、同一时期的另外两条路线

平台时代不只有会员制电商一种形态。有两条平行路线值得记录。

第一条是环球资源的「杂志+展会+网站」三位一体。

环球资源(Global Sources)以面向亚洲供应商的采购贸易杂志起家,拥有约半个世纪的 B2B 贸易出版与展会经验,长期擅长连接中国供应商与欧美市场及大型零售商,在电子、消费品、礼品、家居等行业影响力尤深。它的模式是媒体逻辑:编辑筛选供应商、杂志投递给认证过的专业买家、展会承接线下确认、网站承载线上检索。

与阿里巴巴的开放平台逻辑相比,环球资源是「策展」逻辑——供应商要经过筛选才能进入买家视野。信息量小,但单位信息的可信度高。这条路线服务的是高客单价、低容错的采购场景,至今仍在大额采购领域保有独特位置。

第二条是搜索引擎的竞价排名。

2000 年代中后期,百度竞价排名成为中小企业获客的重要渠道。企业购买产品关键词,采购者搜索时企业官网出现在结果前列。

搜索引擎对工厂信息组织的影响是双刃的。一方面,它绕开了平台的围墙——企业只要有官网就能被找到,不必进入任何平台的会员体系;官网因此在 2005 年前后迎来一轮普及潮。另一方面,竞价排名把「被找到的顺序」直接标价出售,检索结果的排序反映的是出价而不是匹配度,信息质量问题以另一种形式加剧了。

三条路线——开放平台、策展媒体、竞价搜索——在 2000 年代并行生长,共同定义了那十年买家「找厂」的实际体验:先在平台搜,再用搜索引擎核,重要的单子去展会当面谈。三个渠道各有偏差,谁也不敢单独依赖。

四十一、2004:普查追上现实

2003 年,国务院决定将工业普查、第三产业普查和基本单位普查合并,将建筑业纳入普查范围,统称经济普查;第一次全国经济普查以 2004 年 12 月 31 日为标准时点展开。此后经济普查制度化:每五年一次,在逢 3、逢 8 的年份实施。

(这中间还有一段插曲:原定 2003 年开展的第二次全国第三产业普查,因为突如其来的非典疫情严重冲击而推迟,最终与原计划 2005 年的第四次工业普查、2006 年的第三次基本单位普查合并——三项普查并成一项,反而催生了更完整的制度。)

从本文的视角看,经济普查的确立意味着官方统计完成了两个重要转变:

其一,从「工业普查」到「经济普查」,统计对象从生产单位扩展到全部二三产业法人单位。 官方的主体台账第一次覆盖了服务业、贸易业——也就是说,「登记为贸易公司但实际在生产」的那些主体,至少作为主体被数到了,尽管它们的生产属性仍然不可见。

其二,普查结果开始服务于「基本单位名录库」的建设。 普查不再只产出统计公报,还产出一份持续维护的全国单位名录,作为各类常规统计调查的抽样框。这是官方体系内部第一次有了「持续维护的全国企业名录」这个概念。

普查制度五年一轮的节奏,也暴露了它的定位边界:它服务于国民经济核算,不服务于市场检索。普查数据依法只用于统计目的,汇总发布、不可查询单个企业。市场上的「找厂」需求,依然要靠商业服务解决。

官方台账越来越完整,市场服务各有偏斜——两条线并行到 2014 年,终于交汇。

四十二、2008 之后:平台模式撞顶

2008 年全球金融危机之后,出口导向的 B2B 信息服务进入了一个漫长的调整期。

外需收缩直接冲击了会员费模式的根基——出口订单的利润变薄,企业开始重新计算数万元年费的投入产出。同期,跨境电商零售(B2C)兴起,分流了一部分外贸企业的线上预算;国内制造业则开始「外贸转内销」,而内销渠道的信息基础设施远比外贸薄弱。

平台们的应对方向各不相同,但有一个共同点:都没有向「把中国工厂的信息做完整」这个方向走。 有的向交易闭环走(撮合之外做支付、物流、金融),有的向流量生意走(广告、竞价),有的向垂直行业深耕。信息的完整性、准确性、产业维度,始终不是竞争的主战场——因为在会员制的商业模式里,这些投入换不来收入。

到 2013 年前后,平台时代的格局已经定型,它留给「找厂」这个问题的答案可以概括为:

  • 想找愿意被找到的企业,很方便——平台、搜索引擎、展会,渠道充足;
  • 想找不做推广的企业,几乎不可能——它们不在任何可检索的地方;
  • 想判断一家企业是不是真工厂、产能如何,没有工具——诚信通验证身份,验证不了能力;
  • 想获得某个行业完整的企业名单,没有任何渠道——每个渠道都只有自己的切片。

十五年的平台建设,把「找厂」从无路可走变成了有路可走,但每条路都通向同一片区域——那片由营销预算照亮的区域。照不到的地方,比照到的地方大得多。

下一个时代的变化,来自一个完全意想不到的方向:不是更好的商业模式,而是一次登记制度改革。

第五部 公示的时代(2014—2022)

四十三、2014:门槛消失之后

2014 年 3 月 1 日,修订后的公司法施行,注册资本从实缴登记制改为认缴登记制,取消了最低注册资本限制,取消了验资环节。

这次改革的目标是降低创业门槛,效果立竿见影:此后几年,市场主体数量以每年上千万户的速度增长。到 2020 年代中期,全国经营主体总数超过 1.8 亿户。

但对工厂信息而言,认缴制带来的是一个双向的后果。

正面的一面是主体的显性化。 门槛降低之后,大量原本以个体户、挂靠、无照形式存在的生产活动,转化为有限责任公司登记。上一部讲过的那条「统计体系与市场现实之间的裂缝」,在登记层面开始弥合——过去不在账上的主体,现在有了营业执照,有了统一的登记记录。

负面的一面是登记信息的信号衰减。 注册资本从「实缴的钱」变成「承诺的数」,一夜之间失去了作为企业实力指标的意义。本系列第一篇文章分析过,此后十年注册资本字段有三段不同语义,直到 2024 年 7 月新公司法规定五年内缴足,才重新装上时限。

一升一降,合起来就是公示时代的基本处境:主体数量的可见度大幅提升,主体质量的可见度反而下降。 你能查到的企业更多了,但每一条记录告诉你的东西更少了。

这个处境把「加工」的重要性推到了前台。当原始登记信息本身不再携带足够的判断依据,谁能在登记信息之外找到判断依据,谁就掌握了下一阶段的价值。

四十四、从年检到年报:一个动词的替换

与认缴制同一年,另一项改革改变了企业信息的生产方式。

2014 年 8 月,国务院公布《企业信息公示暂行条例》,自当年 10 月 1 日起施行。条例的核心是把企业年检制度改为企业年度报告公示制度,并建立经营异常名录和严重违法失信企业名单。

「年检」与「年报」,一字之差,逻辑相反。

年检是审批逻辑:企业每年把材料交给工商部门,部门审核通过后企业才能继续经营。信息流向政府,由政府背书。

年报是公示逻辑:企业每年自行填报信息并向社会公示,政府不做实质审核,而是通过随机抽查和信用惩戒来约束填报的真实性。信息流向社会,由企业自己负责。

对本文的主题来说,这个替换意味着一件大事:企业信息第一次以「面向社会公示」为默认状态。 在此之前,工商登记信息原则上是行政管理信息,社会查询要经过申请;在此之后,登记信息、年报信息、行政处罚信息,默认对所有人开放。

年报公示的内容里有一项对产业数据极为关键:社保参保人数。 本系列第一篇文章把它评价为「公开信息中最接近真实用工规模的字段」。这个字段之所以存在,正是年报制度的产物——年检时代没有向社会公开这项信息的机制。

一个动词的替换,创造了一个字段。而这个字段,成为此后十年判断工厂规模最可靠的公开依据。

四十五、全国一张网

条例施行之后,随之建设的是国家企业信用信息公示系统——业内称为「全国一张网」。

系统的职能被写得很明确:依法对企业注册登记、行政许可、行政处罚等基本信用信息,以及企业年度报告、经营异常名录和严重违法失信企业名单进行公示,提高市场透明度,并与国家统一的信用信息共享交换平台实现对接和信息共享。

建设过程涉及全国 31 个省区市登记业务系统的改造、升级、对接,并完成了对企业公示系统的改造升级,基本实现了工商、税务、质检等部门的信息共享。

「全国一张网」在中国工厂信息史上的位置,可以用一句话概括:它把主体台账从内部资源变成了公共品。

回顾前面四部:目录时代的台账完整但封闭,名录时代的名录开放但残缺,平台时代的收录由付费划界。三个时代的共同困境是——完整的信息不开放,开放的信息不完整。

「全国一张网」第一次同时满足了两个条件:覆盖全部登记主体,且向全社会免费开放。 一个从未做过任何推广的工厂,只要它办了营业执照,就在这张网上,任何人都能查到它的名称、代码、地址、法定代表人、注册资本、成立日期、经营范围、登记状态、年报信息。

这是本系列第一篇文章那个判断的历史落脚点:「在中国,产业数据的商业价值不在基础登记信息层——公共部门已经把它做完了。」做完它的,就是这张网。

而它的边界也同样清楚,本部后面会专门讨论。

四十六、2015:一照一码

2014 年国务院《关于促进市场公平竞争维护市场正常秩序的若干意见》发布之后,「三证合一」登记制度改革在地方试点中迅速推进。二十七个省实行了「一照三号」——一张营业执照上同时载明工商注册号、组织机构代码、税务登记证号;福建自贸区、江苏宿迁则率先推行「一照一码」——三个号码合并成一个。

2015 年 7 月 3 日,国务院新闻办举行政策例行吹风会,介绍加快推进「三证合一」登记制度改革。国务院办公厅的意见随后部署:2015 年底前在全国全面推行「一照一码」登记模式。

2015 年 10 月 1 日,「三证合一、一照一码」登记制度改革在全国全面实施——距离国务院 2014 年那份文件仅一年有余。

改革的操作层面很简单:企业到登记部门办一次手续,登记部门审核后直接核发加载统一代码的营业执照,并在全国企业信用信息公示系统公示。工商营业执照、组织机构代码证、税务登记证三张证,变成一张证;三个号码,变成一个 18 位代码。

从信息工程的角度看,这次改革做的事情是主键统一。

在此之前,同一家企业在工商、税务、质检三个系统里有三个不同的编号,三个系统之间的数据对不上是常态——要把一家企业在三个部门的记录关联起来,需要人工比对名称、地址,而名称与地址恰恰是最容易不一致的字段。

「一照一码」之后,三个系统共用一个主键。跨部门的数据关联,从一个需要人工判断的模糊匹配问题,变成了一个精确的等值连接问题。

本系列第一篇文章花了整整一章讲「实体对齐」——判断两条记录是不是同一家企业为什么困难、怎么解决。那一章描述的全部困难,都是针对没有统一代码的数据源(招聘、展会、官网)而言的。对于带代码的数据源,对齐问题在 2015 年就被制度性地解决了。

四十七、十八位数字

统一社会信用代码由 18 位组成:登记管理部门代码 1 位、机构类别代码 1 位、登记管理机关行政区划码 6 位、主体标识码 9 位、校验码 1 位。到 2018 年,存量主体的代码转换基本完成,每一个在中国境内登记的法人和其他组织都有且只有一个代码,终身不变。

本文第一部讲过 1904 年商会体系提供的「第一套标准化组织架构」,第二部讲过计划体系内部的产品目录,第四部讲过平台的诚信通档案。统一社会信用代码与它们都不同——它是第一个真正意义上的全国统一主体标识符,由国家建立、免费使用、覆盖完整、终身不变。

放在国际参照系里,这件事的分量更清楚。

美国至今没有国家层面的统一企业标识符。企业信息分散在各州,商业数据机构靠自建编码来解决跨系统识别问题——邓白氏 1963 年推出的 D-U-N-S 九位码,之所以能成为全球通行的企业身份识别体系,一个重要原因就是官方没有提供替代品。一家私营公司发明的编码,成为多个国家政府机构在企业注册或通关时要求提供的信息。

中国选择了另一条路:由国家一次性解决标识符问题,把它做成公共品。

这条路的社会效率显然更高——免费、完整、权威、无锁定。但它也决定了中国不会出现一家「靠标识符收租」的公司。商业机构必须在标识符之上的加工层建立价值。本系列第一篇文章用一章讨论「为什么中国没有长出邓白氏」,答案的核心就在这十八位数字里:基础层被公共部门以更高的效率做掉了,商业机构被推到了更上层。

四十八、2014 年前后:三家公司

统一的公共台账建成之后,市场的反应非常迅速。

2014 年前后,一批企业信息查询工具相继创立,其中最终形成规模的包括企查查、天眼查、启信宝,加上后来的爱企查,业内称为「三查一保」格局。

它们做的事情,在信息结构上是一致的:把公示系统里分散的、按单个企业查询的登记信息,抓取、整合、结构化,再加上司法文书、知识产权、招投标、行政处罚等其他公开来源,做成可以跨企业检索、可以画关系图谱、可以订阅变更提醒的产品。

也就是说,它们做的是加工。公示系统提供的是原料——按企业名称逐个查询的登记记录;查询工具提供的是产品——按任意维度检索、按股权穿透、按风险聚合。

这批公司的成长速度说明了加工价值的规模。据公开信息,企查查在寻求上市时披露的 2024 年营收为 7.08 亿元人民币;天眼查在 2026 年 3 月入选年度中国独角兽企业。相较于邓白氏同期 23.8 亿美元的全球营收,中国企业信息服务市场的体量仍然有数倍差距——而这个差距的背后,是 1.8 亿户经营主体尚未被充分定价的信息服务需求。

在本文的坐标系里,「三查」的出现标志着一个转折:中国工商信息服务的商业模式,第一次从「卖排名」「卖会员」转向了「卖加工」。

平台时代的商业逻辑是向被查的一方收费——供应商付费换取曝光;查询工具的商业逻辑是向查的一方收费——用户付费换取信息。方向反了过来。方向反过来之后,激励也反了过来:平台有动力让付费企业「看起来更好」,查询工具有动力让信息「更准确」——因为付费的是使用信息的人,信息不准他们就不付。

这个激励结构的转变,是公示时代与平台时代最本质的区别。

四十九、查询工具十年:从图谱到监控

从 2014 年前后创立到 2020 年代中期,企业信息查询工具用十年时间,把「加工」这件事的产品形态摸了一遍。回顾这十年,可以看清商业加工在公示数据之上能做什么、做不了什么。

第一代产品是检索。把公示系统里只能按名称逐个查询的记录,做成可以按任意字段组合检索的数据库:按地区、按行业、按注册资本区间、按成立年份、按登记状态。这一步解决的是公示系统的交互限制——它有数据,但只给了一个「输入企业名查一家」的入口。

第二代产品是关系图谱。把股东、法定代表人、高管、对外投资这些登记字段连接起来,画出一家企业的股权穿透图、关联企业图、实际控制人链条。以天眼查为例,其公开表述是收录了全国超过 3.9 亿个社会实体的信息、超过 1100 个数据维度。图谱的价值在于把「单点信息」变成了「网络信息」——一家企业的风险,往往不在它自己身上,而在它的关联方身上。

第三代产品是风险聚合与监控。把司法文书、失信被执行人、行政处罚、经营异常、股权冻结、动产抵押等来源汇总到企业名下,并提供变更提醒——用户订阅一家企业,它的任何登记变更、新增诉讼都会推送。这一步把查询工具从「查一次」变成了「持续盯」。

第四代产品是接口化。把上述能力做成 API 供第三方系统调用,服务金融机构的授信系统、企业的供应商管理系统。2026 年,企查查推出智能体数据平台,以 MCP 方式提供覆盖工商、司法、知产、经营、董监高等维度的 179 个原子能力;同年 1 月,企查查入选江苏省首批数据企业培育名单——「数据企业」这个身份,在公示时代的尾声获得了官方的命名。

四代产品,能力越叠越厚,但有一条边界一直没有被跨过去:它们加工的原料,始终是登记与合规信息。 图谱画的是股权关系,监控盯的是法律风险,接口调的是登记字段。对于「这家企业造什么、产能多大、是不是真工厂」,四代产品都没有直接的答案——因为原料里没有。

这不是查询工具的失职,而是原料的性质。公示信息服务于信用监管,它的每一个字段都围绕合规状态;查询工具在这些字段之上做得再深,也长不出产业属性来。

十年下来,查询工具证明了两件事。一是公示数据之上的加工空间是真实的——检索、图谱、监控、接口,每一层都有人付费,市场规模以十亿元计。二是这个空间有明确的边界——边界就是原料的边界。

要跨过这条边界,不能在公示数据上继续深挖,只能引入公示体系之外的信号。这就是接口时代的起点,也是本系列第一篇文章那句话的历史注脚:「在中国,产业数据的商业价值不在基础登记信息层,而在登记信息之外的产业属性层。前者已经是公共品,后者仍然是无人区。」

五十、免费的基础层与收费的加工层

公示时代形成了一个此前不存在的分层结构,值得单独画出来:

  • 基础层:公共品。 主体登记、代码、状态、年报公示。由国家建设,免费开放,覆盖全部登记主体。
  • 加工层:商业品。 跨企业检索、关系图谱、风险聚合、变更监控。由市场提供,向使用者收费。

这个分层与本系列第一篇文章讨论的公共数据授权运营框架,在逻辑上是相通的:基础数据由公共部门持有,加工与产品化由市场完成,收费发生在产品层而不是原料层。

分层带来了几个后果。

第一,基础层的免费压缩了「信息汇聚」本身的商业价值。 把工商登记信息汇聚起来这件事,因为公示系统已经做了,商业机构无法从中获利。要获利必须做公示系统没做的事——跨源整合、关系分析、变更监控。

第二,加工层的竞争迅速趋于同质。 几家查询工具的数据源高度重叠(都是公开信息),产品形态高度趋同(都是检索加图谱),竞争很快集中在用户体验、覆盖速度和价格上。差异化空间在基础加工层非常有限。

第三,产业属性成为唯一的差异化空间。 公示信息不携带产业属性——查得到一家企业的经营范围,查不到它真正在生产什么、产能多大、是不是真工厂。谁能在这个维度上做出可靠的加工,谁就跳出了同质化竞争。

第三条后果,决定了下一个时代的主战场。

五十一、公示的边界

公示时代把「找到一家企业」这件事做到了前所未有的程度。但它有一条清晰的边界:查得到身份,查不到产业。

这条边界在本系列第一篇文章里被拆成了八个字段逐格讨论,此处从历史角度补一个解释:为什么公示信息注定不携带产业属性?

答案在公示制度的设计目的里。《企业信息公示暂行条例》的立法目的是「保障公平竞争,促进企业诚信自律,规范企业信息公示,强化企业信用约束,维护交易安全」——它服务的是信用监管,不是产业管理。它要回答的问题是「这家企业守不守规矩」,不是「这家企业造什么、造得怎么样」。

因此它公示的信息全部围绕合规状态展开:登记事项、许可、处罚、年报、异常名录。这些信息对判断一家企业的法律风险很有用,对判断它的生产能力几乎没有帮助。

另一条线索是经营范围。公示信息里唯一与「做什么」相关的字段就是经营范围,而经营范围经历了两次演变:先是认缴制之后企业倾向于「能填的都填」,把经营范围写得极宽;然后市场监管总局推行《经营范围规范表述目录》,让经营范围从自由撰写变成标准选项。规范化提高了整齐度,但如第一篇所述,没有提高真实度——企业照样把能勾的都勾上。

于是到 2020 年前后,一个采购者面对公示时代的全部工具,处境是这样的:

  • 想知道一家企业是否合法存续、有没有官司、股东是谁——几秒钟;
  • 想知道全国有多少家企业经营范围里写着「机械制造」——几秒钟,但那个数字没有用;
  • 想知道全国有多少家企业真的在做某种机械——没有任何工具能回答。

公示的边界,就是产业数据的起跑线。

五十二、2016—2019:抓取的灰色地带

公示时代还有一条不那么光彩、但必须记录的支线:数据抓取的法律边界,是在这个时期被一场场诉讼划清的。

信息公开之后,抓取随之而来。查询工具抓公示系统,聚合平台抓查询工具,内容站抓聚合平台。「公开的信息能不能随便抓」这个问题,在 2016 年之后进入了司法程序。

法院逐步形成的判断框架,本系列第一篇文章已经详述,这里只记录它的历史意义:司法实践确认了经过系统性采集、清洗、结构化处理形成的数据集合体,即便原始信息公开,其商业价值也受《反不正当竞争法》保护;同时也确认了公开数据不等于无序滥用——超范围抓取、篡改加工、恶意商用会构成侵权。

这个框架对产业数据行业的塑造作用很大。它划出了一条价值来源的边界:你的价值必须来自你自己的加工,不能来自复制别人的加工。 抓取公示系统的原始记录是一回事,抓取某家查询工具已经整合好的图谱是另一回事。

从历史角度看,这是中国工商信息服务第一次以判例形式确立了「加工成果的财产属性」。第一部讲的行会簿册、第三部讲的商情册子、第四部讲的平台档案,此前从未在法律上被明确认定为可保护的资产。公示时代做到了——而且是通过市场主体之间的诉讼,而不是通过立法。

五十三、2018:1857 万与 327 万

公示时代的成效,在 2018 年末的第四次全国经济普查里以数字的形式显现出来。

2018 年末,全国共有第二产业和第三产业的企业法人单位 1857.0 万个,比 2013 年末增加 1036.2 万个,增长 126.2%。也就是说,五年时间,企业法人单位的数量翻了一倍还多。

结构上,内资企业 1834.8 万个,占 98.8%;其中私营企业 1561.4 万个,占全部企业法人单位的 84.1%;国有企业 7.2 万个,占 0.4%。港澳台商投资企业 11.9 万个,外商投资企业 10.3 万个,各占 0.6%。

按行业分,法人单位数量居前三位的是:批发和零售业 649.9 万个,占 29.8%;制造业 327.0 万个,占 15.0%;租赁和商务服务业 255.1 万个,占 11.7%。

按区域分,东部地区拥有法人单位 1280.2 万个,占 58.8%;中部地区 492.9 万个,占 22.6%;西部地区 405.8 万个,占 18.6%。

五年增长 126.2%,这个增速是认缴制改革在普查数据里的直接显形。2014 年 3 月取消最低注册资本与验资之后,登记门槛几乎归零,大量原先以个体户、挂靠或无照形式存在的经营活动转为法人登记。普查数到的不只是新增的经济活动,还有存量活动的登记形态转换。

对本文的主题来说,四经普提供了一个关键的观察窗口:327.0 万个制造业法人单位。

把它放进本文的数字序列里:1985 年,35.8 万家乡以上独立核算工业企业;1995 年,734.2 万个工业企业和生产单位;2018 年,327.0 万个制造业法人单位;2023 年,404.9 万个制造业法人单位。

这四个数字的口径互不相同,不能连成一条增长曲线。但它们共同勾勒出一个事实:中国制造业主体的数量,无论按哪种口径,都在数百万量级,而且这个量级已经保持了三十年。

而 2018 年到 2023 年之间,制造业法人单位从 327.0 万增加到 404.9 万,五年净增约 78 万个。这 78 万里有多少是真实的新增产能,多少是登记形态的转换(个体户转法人、分厂独立登记),多少是主体分立带来的重复计数——普查本身无法回答。因为普查记录的是法人单位,而法人单位与生产单位、与「一家工厂」之间的关系,正如本系列第一篇文章第八章所讨论的,从来不是一对一。

这就是公示时代在宏观层面的边界:登记体系可以精确地数出有多少个法人,却无法回答有多少个真正在生产的物理厂区。这两个数字之间的差距,需要登记信息之外的信号才能弥合。

四经普还有一个数字值得一提:全国文化及相关产业法人单位 210.3 万个,比 2013 年末增长 129.0%。文化产业与制造业增速相当,说明 2013 年到 2018 年的主体爆发是全面的,不是制造业独有的现象。

从普查方法的角度看,四经普是中国经济普查制度成熟的标志——五年一轮的节奏已经稳定,普查内容覆盖二三产业全部法人单位、产业活动单位和个体经营户,并开始为「基本单位名录库」提供持续更新的基础。到下一次普查——2023 年末的第五次——普查内容还将新增平台经济、数字经济等「三新」经济的专门调查。

官方台账在四经普时已经相当完整。完整的台账加上免费的公示,构成了公示时代留给下一个时代的起点。

五十四、2020—2022:需求换了形状

2020 年到 2022 年,三年疫情深刻改变了制造业的信息需求。

变化来自供应链的反复扰动。停工、物流中断、原材料涨价、海运舱位紧张——每一次扰动都让企业发现自己对供应链的了解远远不够:一级供应商停产了,二级供应商是谁?某种原材料断供了,全国还有哪些厂能做?这种零件从东南亚进不来了,国内能不能找到替代?

这些问题在平台时代和公示时代的工具里都没有答案。它们需要的不是「某家企业的详细信息」,而是「某个条件下的完整候选名单」——本系列第一篇文章用「深」与「广」区分了这两类需求,而疫情期间集中爆发的是「广」的需求。

同一时期,出口的形态也在变。广交会 2020 年第 127 届起连续多届在网上举办,2021 年 10 月第 130 届首次线上线下融合。线上化让展会能够继续,但也把展会最核心的价值——面对面的确认——压缩到了最低。海外买家找中国供应商的传统路径被切断,转向线上;而线上能看到的,依然是那片由营销预算照亮的区域。

需求的形状变了:从「查一家」变成「找一批」,从「验一家」变成「筛一批」。旧工具应付不了新形状。

这就是接口时代到来前夕的市场处境。变化的技术条件已经在路上——2022 年底,第一个大规模可用的对话式大模型发布。

五十五、2024:给认缴制打补丁

公示时代的最后一件大事,发生在它与接口时代交界的地方。

2023 年 12 月,公司法完成修订,自 2024 年 7 月 1 日起施行。新法对 2014 年确立的认缴制打了一个补丁:有限责任公司全体股东认缴的出资额,应当自公司成立之日起五年内缴足。

这条规定的直接背景,是认缴制运行十年后暴露出来的问题。取消最低注册资本与验资之后,「注册资本一亿元、实缴零元」的公司大量出现,注册资本从企业实力的证明退化成股东承诺的数字。在交易中,对方公司的注册资本已经无法作为判断依据;在债务纠纷中,认缴期限动辄三五十年,债权人很难追到实缴的钱。

五年缴足的规定,把承诺重新与时间挂钩。它引发了一轮存量公司的减资潮——大量此前虚高认缴的公司主动把注册资本调低到自己能够在五年内实缴的水平。

对本文的主题来说,这条补丁有两层意义。

第一层是字段语义的第三次切换。 本系列第一篇文章指出,注册资本这个字段在不同年份成立的企业上有三段不同的语义:2014 年之前登记的是实缴,2014 年到 2024 年之间登记的是不带时限的承诺,2024 年之后登记的是五年内必须兑现的承诺。用同一个阈值去筛不同年份成立的企业,比较的不是同一件事。

这是本文反复出现的那个主题的又一个实例:登记字段的含义随制度变化而变化,而字段本身的名字不变。 一个只看字段名、不看制度史的使用者,会把三种不同的东西当成一种。

第二层是信号价值的部分恢复。 五年缴足之后,注册资本重新成为一个有约束力的数字——至少在五年的尺度上,它反映了股东愿意并且能够投入的资金规模。对于成立于 2024 年 7 月之后的企业,这个字段的可用性回升了;对于存量企业,减资之后的新数字比减资之前更接近真实。

但恢复是部分的。五年是一个很长的窗口,一家成立两年的公司仍然可以处于「已认缴、未实缴」状态;而且认缴与实缴的区分,在公示信息里需要分别查看,简单抓取「注册资本」一栏得到的仍然是认缴额。

从编年史的角度看,2024 年的补丁说明了一件事:登记制度本身也在为「信息的可信度」买单。 2014 年为了降低门槛而牺牲了注册资本的信号价值,十年之后又用五年期限把一部分信号价值买了回来。放开与收紧之间的这个往返,本质上是在「让更多主体被登记」与「让登记信息更可信」之间寻找平衡——而这正是本文第一部 1929 年《工厂法》推迟十九个月、1931 年登记规则要求二十五项时,就已经在处理的同一对矛盾。

九十五年,同一对矛盾,换了一副面孔。

第六部 接口的时代(2023— )

五十六、2023:语义墙被凿开

2022 年底,第一个大规模可用的对话式大语言模型面向公众发布。此后一年里,「大模型」从技术圈的名词变成所有行业的议题。

对工厂信息而言,大模型带来的第一个实质性变化,不是「人工智能」这个宽泛的概念,而是一件具体的事:它第一次让机器能够读懂非结构化的产业文本。

回顾前五部,工厂信息的每一次进步,本质上都是「结构化」的进步:1931 年的二十五项登记附表是结构化,产品目录是结构化,黄页的字段是结构化,平台的企业档案是结构化,公示系统的登记记录是结构化。结构化的意思是,信息被事先规定好的格子装起来,机器只能处理格子里的东西。

而工厂最有价值的信息,大部分不在格子里。

一家企业的招聘广告写着「招五轴加工中心操作工,熟悉钛合金,有航空零件经验优先」——这句话里有设备类型、材料能力、下游行业三层信息,但它不在任何格子里,它是一段自由文本。一份中标公告写着「××公司中标××医院内窥镜维修服务」——这说明这家公司有医疗器械维修资质和实际业务,但它也不在格子里。一个官网的产品页写着「我们为新能源汽车电池包提供铝合金压铸壳体,最大投影面积……」——它也不在格子里。

在大模型之前,从这些文本里提取信息依赖规则和词典,词典里没有的词永远抽不出来。本系列第一篇文章把这种方法的天花板描述为「由词典的完备程度决定」,而产品词是一个长尾极长的集合,词典永远追不上。

大模型改变了这一点。它能在没有见过某个具体产品词的情况下,依据上下文判断「这是一个产品名称」「这是一种工艺能力」「这是一个下游行业」。抽取的召回率因此有了实质性提升,尤其在长尾品类上。

这就是「语义墙被凿开」的含义:格子之外的信息,第一次可以被机器大规模读取。 而格子之外的信息,恰恰是「这家企业是不是真工厂、在造什么、造得怎么样」这些问题的答案所在。

第一部讲过,1931 年的登记附表有二十五项,但填表的对象寥寥无几;公示时代的登记覆盖了全部主体,但格子里只有合规信息。大模型提供的可能性是:不再依赖填表,而是从企业自己在各处留下的文字里,把那二十五项重新读出来。

当然,凿开一堵墙不等于穿过去。本系列第一篇文章用一章讨论了大模型「能做什么,不能做什么」——它能抽取,不能编造;它能理解,不能替代口径定义;它让边际成本从人力变成算力,但没有让成本归零。这些边界在 2023 年之后的两年里被行业反复验证。

但方向已经清楚了:一百二十年来第一次,「让机器读懂工厂」在技术上成为可能。

五十七、2023 年末:404.9 万个

同一年的年末,第五次全国经济普查以 2023 年 12 月 31 日为标准时点展开。普查结果于 2024 年 12 月 26 日发布。

普查结果显示,2023 年末,全国第二产业和第三产业法人单位数比 2018 年末增长 52.7%;法人单位从业人员 42898.4 万人,比 2018 年末增加 4574.8 万人,增长 11.9%;法人单位资产总计 1439.1 万亿元,增长 57.4%。2023 年,第二产业和第三产业企业法人单位实现营业收入 442.6 万亿元,比 2018 年增长 50.2%。

分行业看,制造业法人单位 404.9 万个,占全部法人单位的 12.2%。

普查还有两个细节值得记录。其一,普查事后质量抽查结果表明,普查数据填报综合差错率为 4.7‰,普查数据质量符合控制标准——这是官方对自身数据质量的量化披露,在产业数据领域相当罕见。其二,2023 年国内生产总值按普查数据修订的幅度,与前四次经济普查的修订增幅相比是最小的,说明常规年度统计数据的质量在不断提高。

五经普在内容上还新增了对平台经济、数字经济等「三新」经济的普查内容,反映出统计体系开始追踪经济形态本身的变化。

把 404.9 万放进本文的数字序列,是这一百二十年里最权威的一次制造业主体计数:

  • 它是法定普查,覆盖全部法人单位,不设营收门槛;
  • 它有明确的口径定义(制造业门类下的法人单位);
  • 它有事后质量抽查(差错率 4.7‰)。

同时,它也把公示时代的边界再次显现出来。404.9 万个法人单位,与「有多少个真正在生产的工厂」之间,至少隔着三层:法人单位不等于生产单位(一个法人可以有多个厂区,一个厂区可以挂多个法人);登记为制造业不等于实际在制造(本系列第一篇第十章的核心论点);实际在制造的不一定登记为制造业(个体工商户形态、登记在其他门类的主体)。

普查回答了「有多少个制造业法人」,这个问题它回答得很好。它不回答「有多少家工厂」——这不是普查的任务,也不是任何登记体系的任务。

而市场需要的恰恰是后一个问题的答案。

五十八、数据要素:一百二十年的问题写进制度

2022 年 12 月,《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》发布,提出数据资源持有权、数据加工使用权、数据产品经营权「三权分置」的产权框架。2023 年 10 月,国家数据局挂牌。2024 年 1 月,国家数据局等 17 部门印发《「数据要素×」三年行动计划(2024—2026 年)》,选取工业制造在内的 12 个行业和领域。2025 年 1 月,公共数据资源登记、授权运营、价格形成机制三份配套文件出台。2026 年 2 月,四部门发布培育数据流通服务机构的意见,把「数据商」正式纳入制度分类。

这条制度链,本系列第一篇文章已经完整梳理过。本文关心的是它在这一百二十年编年史里的位置。

这是第一次,「把散落的信息加工成可用的数据」这件事本身,被当作一个独立的经济活动写进了国家制度。

回头看前五部:1931 年的登记规则关心的是登记,1950 年的普查关心的是清点,名录时代的出版商关心的是印刷,平台关心的是撮合,公示关心的是信用监管。加工——把原始信息变成可用产品的那道工序——从来都是附带发生的,没有被单独命名,没有被单独定价,没有被单独保护。

三权分置第一次把「加工使用权」从「持有权」里分离出来,等于承认了加工者是一个独立的权利主体。公共数据授权运营的价格形成机制第一次把加工成本——平台建设、传输汇聚存储治理、人力、数据获取——写进了官方的成本清单。数据资产入表第一次让加工投入有了进入资产负债表的路径。数据流通服务机构的分类第一次让「数据商」与交易所并列。

从 1918 年张元济亲自查名录调查稿开始,一百零八年里加工者做的事情没有本质变化:核实、整理、更新。变化的是,这件事在 2020 年代终于有了制度上的名字。

当然,制度有名字不等于市场有答案。第一篇文章的核心判断是:制度屋顶已经封顶,加工环节的地基仍然悬空——通用产业数据加工落在现有四条买单路径的缝隙里。这个判断在编年史的视角下可以补充一句:悬空不是新问题,它悬了一百二十年;新的是,这一次它被看见了。

一件事只有被看见,才可能被投资。

五十九、另一条加工线:高质量数据集

接口时代还有一条与工厂数据平行的加工线,它的增长速度快得多,值得在编年史里单独记一笔:高质量数据集。

所谓高质量数据集,指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、能有效提升模型性能的数据的集合,包含行业通识和行业专识数据集。它的用途不是「被模型调用」,而是「用来训练模型」——这是它与工厂数据的根本区别。

它的增长曲线是这样的:截至 2026 年 6 月底,全国已建成高质量数据集超过 12 万个,总体量超过 1565 PB,较一季度末增长超过 60%;截至 2026 年 8 月,累计建成超过 12.6 万个,总体量超过 1815 PB,较 2026 年 3 月增长超过 89%。半年时间,体量接近翻倍。

支撑这条曲线的是一整套配套体系。国家数据局指导研制了《高质量数据集建设指南》《高质量数据集格式要求》《高质量数据集分类指南》等 5 项国家标准,初步构建起「数据质量检测+基准模型验证」相结合的质量检测方法和工具,已对 12 个数据集、超过 4563 万条数据完成检测。国家数据局还印发了《关于推进行业高质量数据集建设行动的实施方案》,部署强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六个专项行动,明确到 2028 年底建成一批覆盖重点领域、经过应用验证的行业高质量数据集。

产业配套同步成长。2024 年我国数据标注产业规模突破 80 亿元,年均增速超过 20%;国家层面布局了「7+32」数据标注先行先试格局,7 个国家级数据标注基地已建成高质量数据集 524 个,服务 163 个大模型,带动相关产值超过 83 亿元。

在制造业这一侧,2026 年 1 月工业和信息化部等八部门印发的《「人工智能+制造」专项行动实施意见》提出,到 2027 年打造 100 个工业领域高质量数据集,推出 1000 个高水平工业智能体。数据集与智能体的目标被写在同一份文件里,反映的是一个基本判断:智能体的能力上限由数据供给决定。

把这条线放进本文的坐标系,有两点值得说。

第一,它证明了「用途具体则加工价值可被支付」。 高质量数据集的买家是模型训练方,需求刚性、连续、愿意为质量付溢价;一份数据集好不好,用基准模型跑一遍就能验证,闭环极短。用途具体、验证快、付费意愿强,加工投入就有回报,产业就能自我循环。这与本系列第一篇文章对数据交易长期低迷的解释——「用途不够具体」——正好互为对照。

第二,它与工厂数据在「行业知识」上交汇。 一份工业领域的高质量数据集,要标注工艺、设备、缺陷、参数,标注的依据是行业知识;一份可靠的工厂数据,要判断工艺方向、设备类型、产能量级,判断的依据也是行业知识。两条加工线的原料不同、产品不同、买家不同,但中间那道「懂行」的工序是同一道。本文第四部讲 1997 年中国化工网时说过,产业信息的可信度与加工者对行业的理解深度正相关——这条判断在两条线上同时成立。

高质量数据集这条线跑得快,说明当加工的价值能被快速验证、快速支付时,市场的响应速度远超预期。工厂数据这条线跑得慢,问题不在市场没有需求,而在需求的验证周期长、支付路径不清晰。两条线的对照,本身就是第一公里经济学的一个实验结果。

六十、2024—2026:出海的数据身份

本文第二部讲过,1957 年的广交会是那个年代唯一一条面向境外的工厂信息通道——一年两次、一个城市、一个展馆。七十年之后,这条通道变成了什么样?

先看规模。2025 年,我国有进出口记录的经营主体超过 78 万家,其中民营企业进出口 26.04 万亿元,增长 7.1%,占进出口总值的比重提升至 57.3%。在专精特新「小巨人」企业的外贸总值中,民营企业占比超过七成。

七十年前,一个海外采购商只能在广州的展馆里认识中国工厂;今天,78 万家有进出口实绩的主体分布在全国,通过平台、展会、跨境电商、外贸代理各自与境外发生联系。通道从一条变成了无数条。

但通道多了,境外买家的核心困难没有变:他怎么知道对面这家中国工厂是真的、是靠得住的?

七十年前,广交会用组织信誉替代了主体信息——展会背书,买家不必自己核实。今天,这个替代机制的能力已经远远跟不上主体数量。平台的认证只能证明身份,验厂只能覆盖少数已经进入最终名单的工厂,展会一年几次。境外买家面对的是一片信息密度极不均匀的区域:做推广的企业信息过剩,不做推广的企业信息为零。

与此同时,境外的合规要求在提高。欧盟《企业可持续发展尽职调查指令》(Directive (EU) 2024/1760)于 2024 年 7 月 25 日生效,要求适用企业识别、预防、减轻并补救其自身运营、子公司以及整个「活动链」中的人权与环境风险;此后通过综合法案大幅修订,适用门槛提高、评估频率放宽,直接纳入的中国企业范围收窄——但链式传导仍然存在:中国供应商即便不在直接适用范围内,也会因欧盟客户需要履行尽职调查义务而被要求提供相应信息。

于是出现了一个新的需求:中国工厂需要一份可以被境外买家核验的数据身份。

这与本文第五部讲的统一社会信用代码形成了一组对照。18 位代码在国内是权威、完整、免费的主体标识;但在境外,它的可识别性和可解释性有限——一个德国的采购经理拿到一串 18 位数字,没有便捷的渠道把它翻译成自己能理解的企业画像。而邓白氏编码之所以在国际贸易中长期通行,正是因为多个国际组织和欧盟、美国、日本、中东等国家和地区的政府机构把它作为企业注册或通关时必须提供的信息之一。

标识符的国内权威与国际可识别,是两件事。中国在前一件上做得很好,后一件上仍有明确的空白。

再看数据出境的合规框架。2024 年 3 月,国家网信办出台《促进和规范数据跨境流动规定》,放宽数据跨境流动条件、收窄安全评估范围:明确了免予申报安全评估的情形,规定未被相关部门告知或公开发布为重要数据的,数据处理者不需要作为重要数据申报安全评估;并设立自由贸易试验区负面清单制度。

把这套框架应用到工厂数据上,可以得到一个大致的分层:不包含个人信息、也未被认定为重要数据的企业公开信息,出境的合规负担较轻;包含个人信息的部分(如联系人姓名与电话)需要走标准合同、认证或安全评估之一;涉及产业整体产能分布的汇总性数据,需要审慎判断是否落入重要数据范畴。

从编年史的角度看,「出海的数据身份」是广交会那条通道的当代延伸。1957 年,中国用一个展馆向世界介绍自己的工厂;2026 年,中国的几百万家工厂需要各自拥有一份能被世界读懂、核验、持续更新的数据画像。前者靠组织,后者靠数据;前者一年两次,后者随时可查。

这件事的商业价值和产业价值都是明确的:它同时服务于中国制造的出口竞争力和境外采购方的供应链安全。而它的前提,与本文讨论的一切一样,是那一段没有人被明确指定去完成的工作——把几百万家工厂的信息加工到可信、可调用的程度。

七十年前的那条通道,今天需要被重建成一层数据。

六十一、从查询到调用

2024 年 11 月,模型上下文协议(MCP)被提出,用于规范大模型与外部数据、工具之间的调用行为。此后一年多,这个协议被主流模型客户端与开发工具广泛采纳。

对工厂信息而言,MCP 的意义在于它标志着信息的主要消费者正在从人变成机器。

回头看六个时代的「消费者」:认脸时代是商人本人,目录时代是计划编制者,名录时代是翻名录的供销员,平台时代是浏览网页的采购员,公示时代是点击查询的风控员。六个时代,消费者都是人。信息服务的所有设计——分类方式、检索界面、展示格式——都是为人的阅读习惯设计的。

接口时代的消费者是模型。模型不看界面,它调接口;模型不翻页,它发请求;模型不靠常识补全字段含义,它要求每个字段都有无歧义的定义。

这个转变对信息的组织方式提出了与前五个时代完全不同的要求:

  • 确定性优先于可读性。 人可以看懂「大约三百人」,机器需要「300」加上「估算」标记。
  • 结构必须稳定。 人可以适应界面改版,机器的调用代码会因为一个字段改名而失效。
  • 错误必须有编码。 人看到「查无此企业」会理解,机器需要一个明确的错误码来决定下一步。
  • 每一次访问都是可计量的事件。 界面时代按席位收费,接口时代按调用计费——2025 年 1 月的官方定价文件已经把「数据调用量」列为公共数据产品可选的收费形式。

市场已经出现了对应的实践。企业信息查询工具在 2026 年推出面向智能体的数据平台,以 MCP 方式提供覆盖工商、司法、知产、经营、董监高等维度的 179 个原子能力;面向产业属性的工厂数据平台则以 MCP 与 REST 双门面提供工厂检索、企业详情、联系方式、深度尽调、智能体检索等能力。这些实践的共同点是:把数据能力拆成机器可以直接调用的原子操作,而不是提供一个需要人来操作的界面。

在编年史的尺度上,这是自 1999 年信息上网以来最大的一次形态迁移——比从纸到网的迁移更深,因为那次迁移只换了载体,没有换消费者。

六十二、第一公里上的人

接口时代的主战场,是本系列第一篇文章反复讨论的那一段:把公开信息加工成可信、可调用的产业数据。在这一段上工作的机构,值得在编年史里留下一笔——不是因为它们已经完成了什么,而是因为它们正在做一百二十年里一直有人在做、但从未被单独命名的那件事。

以天下工厂产业平台为例。按其对外披露的口径,该平台的工厂库覆盖 480 万家工厂,判定依据不是登记行业门类,而是多源硬信号——招工记录、设备与厂房痕迹、中标记录、进出口活动、专利与资质、展会与团体成员身份——的交叉验证;在此基础上构建了 1965 个细分行业类目、标注了 1000 个以上的产业带,识别出超过 300 万家带有决策人直连联系方式的工厂和 108 万家有外贸业务迹象的工厂;并以开放平台的方式,按调用次数对外提供五项能力,公开的单次计价在 0.1 元到 0.25 元之间,失败不计费,重复调用同一家企业的联系方式不重复计费。

把这套做法放进编年史,可以看到它与每一个时代的呼应:

  • 「多源硬信号判定」对应 1931 年《工厂登记规则》把商业登记与工厂登记分开的思路——生产身份需要单独证明;
  • 「1965 个细分类目」对应 1944 年《上海行名录》把「各大工厂」列为第一类、以及计划时代产品目录的细粒度——分类必须细到买方能用的程度;
  • 「产业带标注」对应乡镇企业时代那些统计视野之外、分散在几十万个村镇里的产能——把最难收录的那一层收进来;
  • 「决策人联系方式」对应 1944 年名录附录的「百业人士住址」和电话普及曲线——找企业最终是找人;
  • 「按次调用、失败不计费」对应公示时代形成的「向使用者收费」的激励结构——付费的是用信息的人,信息不准他们就不付。

天下工厂不是唯一的实践者。企业信息查询工具在向智能体接口迁移,行业数据服务商在把行业知识沉淀为可调用的能力,高质量数据集的建设也在快速推进——国家数据局披露,截至 2026 年 8 月,全国已建成高质量数据集超过 12.6 万个、总体量超过 1815 PB。第一公里上的人在变多。

但也要如实记录这一段的处境。加工环节的投入是前置的、重资产的、回收周期长的,而且有强正外部性——一份高质量的工厂数据存在时,全社会节省的重复采集成本远大于加工者能收取的费用。这个结构决定了市场会系统性地投入不足。今天的从业者面对的经济学困境,与 1918 年商务印书馆做名录时的困境是同一个:准确性的成本由加工者承担,准确性的收益由所有人分享。

一百二十年里,这个困境从未被彻底解决。它只是被一代又一代人以不同的方式承担了下来。

六十三、一个采购员的一天:六个时代同时在场

编年史容易给人一种错觉:新时代来了,旧时代就走了。实际上,工厂信息的六种组织方式今天仍然全部在场,而且经常出现在同一个人的同一天里。

下面是一个示意性的场景——不指涉任何具体的人,只用来说明六种机制如何并存。

假设一位家电企业的采购员,接到任务:为一款新产品寻找一家能做铝合金压铸壳体的备选供应商,要求在华东、有 IATF 16949 认证、月产能能覆盖十万件、且不能与现有供应商是关联企业。

上午九点,接口时代。 她打开一个对话式工具,用一句话描述了上面的需求。工具在几秒钟内返回了几十家候选,附带每家的所在地、判定为压铸企业的依据(招聘过压铸工、有压铸相关专利、中标过压铸件采购)、认证状态、社保人数分档。这一步替代的是本系列第一篇文章描述的「把需求翻译成筛选条件」的工作,以及此前需要几天才能完成的初筛。

上午十点,公示时代。 她把候选名单里排在前面的十家,逐一在企业信用信息公示系统和查询工具里核对:登记状态是否存续、有没有未了结的诉讼、股东里有没有现有供应商的关联方。查询工具的股权图谱帮她排除了两家——它们的实际控制人与现有供应商是同一个。

上午十一点,平台时代。 她打开其中几家的官网和 B2B 平台店铺,看产品图、看设备照片、看有没有同类客户的案例。有两家的官网五年没更新,她打了个问号;有一家在平台上是「贸易商」类型,她划掉了。

下午两点,名录时代。 她开始打电话。名单上有三家提供了采购或技术负责人的直线,两家只有总机。直线的三通电话里,两通接了,一通说负责人换了;总机的两通里,一通被前台拦下,一通转到了销售部。

下午四点,目录时代。 她翻出公司内部的供应商管理系统——这套系统本质上就是本文第二部讲的「主管部门台账」的企业版:只记录已经合作过的供应商,信息完整但封闭。她想看看这几家里有没有以前接触过的,结果一家都没有。

傍晚,认脸时代。 她给一位在压铸行业做了二十年的老供应商发了条消息:「宁波这家你听说过吗?」对方回了三个字:「靠得住。」她把这家排到了第一位,计划下周去看厂。

一天下来,六种机制她全用了:接口给候选,公示给身份,平台给印象,电话给触达,内部台账给历史,熟人给确认。

没有任何一个时代被完全替代。 新工具做的事情是压缩前段——把候选从几天缩到几秒,把初筛的候选池从几家扩到几十家——而后段的确认,依然靠人。

这个场景里还藏着一条更细的观察:每一个时代的工具,都恰好补上了另一个时代的盲区。 接口给的候选需要公示来核身份,公示给的身份需要平台来看印象,平台给的印象需要电话来触达,电话触达的结果需要熟人来定心。六种机制不是替代关系,是一条流水线上的六道工序。

这条流水线的效率,取决于每道工序之间的衔接成本。而衔接成本最高的一道,从 1902 年到 2026 年一直没变:从「信息告诉我可能行」到「我确定它行」之间的那一步。 数据把这一步之前的所有工作都压缩了,但这一步本身,仍然要有人去看一眼、问一句、或者找一个信得过的人问一句。

编年史写到这里,可以给「找厂」这件事下一个跨越一百二十年的定义:它是一个不断把确认成本前移的过程——把原本要到现场才能知道的事,尽量在出发之前就知道。 每一个时代都往前移了一段,没有一个时代移到了终点。

六十四、一百二十年的数字表

把本文出现过的所有「工厂数量」类数字集中列出来,每一个都带口径,是这部编年史最有实用价值的一页。

时点 数字 口径 来源性质
1933 年 三四百户 汉口一地,符合《工厂法》定义的工厂 地方社会局调查
1978 年 152 万个 全国乡镇企业(含各种形态) 农业部门统计
1985 年 35.8 万个 乡以上独立核算工业企业 第二次全国工业普查
1995 年 734.2 万个 全部工业企业和工业生产单位(含采矿、电力) 第三次全国工业普查
1996 年 2336 万个 全国乡镇企业(含户办、联户办) 农业部门统计
2018 年 327.0 万个 制造业法人单位 第四次全国经济普查
2023 年 404.9 万个 制造业法人单位 第五次全国经济普查
2025 年 5 月 246 万家 登记行业门类为制造业的企业 统一社会信用代码数据服务中心
2025 年末 43.6 万家 规模以上工业企业(年主营业务收入 2000 万元以上) 国家统计局
2026 年 480 万家 经多源信号判定有实际生产活动的经营主体档案 天下工厂产业平台

十个数字,十种口径,没有任何两个可以直接相减。

但把它们放在一张表里看,能读出几件事。

第一,「工厂」这个词从来没有过统一定义。 1933 年按《工厂法》的门槛,1985 年按核算层级,1995 年按生产单位,2018 年和 2023 年按法人,2025 年按登记门类,规模以上按营收门槛,商业平台按生产活动判定。每一次计数都对应一个不同的问题。

第二,量级在三十年前就已经确定。 从 1995 年的 734.2 万开始,无论用哪种口径,中国工业主体的数量都在数百万量级。此后的变化更多是口径的收缩与展开,而不是量级的跃迁。

第三,官方口径与市场口径之间的差距是结构性的,不会消失。 官方口径服务于统计与监管,边界必须清晰、可比、稳定;市场口径服务于交易,边界必须贴近「买方眼里什么算工厂」。两者的目的不同,数字自然不同。

第四,同一个时点可以并存多个口径,而且都是对的。 2023 年到 2025 年之间,404.9 万、246 万、43.6 万、480 万四个数字并存,各自回答各自的问题。读者需要的不是「哪个对」,而是「哪个回答了我的问题」。

这张表本身就是本系列第一篇文章那条方法论的历史证明:每个数字都必须挂一个定义。 不是因为讲究,而是因为不挂定义,这张表上的任何两个数字放在一起都会引起「数据打架」的误判。

六十五、口径的谱系

上一章的数字表列了十个数字、十种口径。这一章把口径本身拆开看:一百二十年里,「什么算工厂」这个问题被回答过七种方式,每一种背后都有一套逻辑,也各有一片盲区。

第一种:法律门槛。 1923 年《暂行工厂通则》和 1929 年《工厂法》的做法——以是否使用动力设备、雇工是否达到一定人数为界。逻辑是:法律要保护工人,先得界定适用范围;门槛以下的作坊不受工厂法约束,也就不算工厂。它对监管有用,对统计的盲区是门槛以下的海量小生产单位——1933 年汉口只数出三四百户,就是这个原因。

第二种:核算层级。 1985 年第二次工业普查的做法——以「乡以上独立核算」为界。逻辑是:统计体系的触角到乡为止,乡以下的生产活动在管理上归农村副业。它与当时的行政管理层级一致,盲区是村办、联户办、户办企业——恰恰是那十年增长最快的部分。

第三种:生产单位。 1995 年第三次工业普查的做法——数「全部工业企业和工业生产单位」,734.2 万个。逻辑是:只要在生产,不论核算层级、不论登记形态,都数进来。它的覆盖最宽,盲区在另一头:一个法人下面的多个厂区被分别计数,「单位」与「企业」的关系变得模糊,数字难以与法人层面的其他统计对接。

第四种:法人单位。 2018 年和 2023 年经济普查的做法——数「制造业法人单位」,327.0 万和 404.9 万。逻辑是:法人是有权拥有资产、承担负债、独立从事经济活动的组织,以它为单位,数字可以与财务、税收、社保对接。它的可比性最好,盲区有两片:登记为制造业的法人不一定在生产,实际在生产的个体工商户不是法人。

第五种:登记门类。 统一社会信用代码数据服务中心 2025 年的做法——数「登记行业门类为制造业的企业」,246 万家。逻辑是:以登记为准,登记里写的是什么就是什么。它最容易获取、更新最快,盲区与第四种类似,且因为只计企业不计其他法人形态,比普查口径更窄。

第六种:营收门槛。 国家统计局「规模以上工业企业」的做法——年主营业务收入 2000 万元及以上,43.6 万家。逻辑是:常规统计要按月出数,只能覆盖规模较大、报表规范的企业。它的时效最好、指标最全,盲区是门槛以下的全部——按数量算,超过九成的制造业法人不在其中。

第七种:信号判定。 商业平台的做法——以招聘、设备、中标、进出口、专利、展会等多源信号交叉判定「是否有实际生产活动」,不以登记门类和主体形态为唯一依据。天下工厂产业平台的 480 万家工厂档案属于此类。逻辑是:买方眼里的工厂是「真的在造东西的地方」,不是「登记表上写着制造的主体」。它最贴近交易需求,盲区在于判定规则由加工者自行定义,不同加工者之间不可比,且判定本身有精度与召回的取舍。

把七种口径排成一列,可以看到一条清晰的演变线:

  • 前三种口径由管理需要决定(监管谁、管到哪一级、算哪些单位);
  • 中间三种由统计与登记的技术条件决定(以什么为主键、数据从哪里来、多久出一次);
  • 最后一种由使用者的需要决定(买方要找什么)。

也就是说,「什么算工厂」的定义权,一百二十年里从管理者手里,经过统计者,正在部分转移到使用者手里。

这个转移带来一个新问题:使用者的需要是多样的,因此使用者定义的口径也必然是多样的。 一个卖工业润滑油的销售需要的「工厂」,和一个做供应链合规的审查员需要的「工厂」,和一个县域银行需要的「工厂」,定义不同。没有任何一种口径能同时满足三者。

对接口时代的数据底座来说,这意味着一件具体的事:口径不能写死在数据里,要能按用途切换。 同一个底座,对销售场景输出「有生产活动且有决策人可达」的集合,对合规场景输出「有生产活动且资质有效且无重大司法风险」的集合,对金融场景输出「有生产活动且经营活性信号连续」的集合。三个集合的交集与差集都能被明确算出来,而不是各自给一个不可比的总数。

这是七种口径演变到今天,对下一步提出的技术要求:不是再发明第八种口径,而是让前七种可以在同一个底座上被同时表达。

六十六、七代载体:一张五维清单

本文第三部结尾列过纸的五条极限:容量、检索、更新、分发、反馈。把这五条当作坐标,可以给一百二十年里出现过的每一代信息载体打一次分。这张表是本文全部叙述的压缩版。

载体 代表 容量 检索 更新 分发 反馈
手抄簿册 行会会员簿、商会名录 极低 无 手工,不定期 不流通 无
铅印名录 《上海商业名录》、《行名录》 低 单维(按类或按笔画) 按版次,年级 有限,按册 无
内部台账与目录 计划时期产品目录 中 按产品 按计划周期 不对外 体系内有
油印商情 《慧聪商情广告》 低 按行业分册 按期,周或月 有限,按册 无
电话查号 114 中 单维(按名称) 相对及时 按次应答 无
网页平台 B2B 平台、官网 高 多维 实时 零成本 弱(询盘可见)
公示数据库 全国一张网、查询工具 高 多维、可穿透 按登记变更 零成本 弱(异常名录)
调用接口 MCP、REST 高 任意 实时 零成本,机器对机器 可能闭合

(表中把「网页平台」与「公示数据库」分列,是因为二者的数据来源与激励结构不同;连同「内部台账」在内,实际是七代八种形态。)

看这张表,前四列的演变方向非常清楚:容量从极低到高,检索从无到任意,更新从不定期到实时,分发从不流通到机器对机器。每一代都在前一代的短板上前进,到接口时代,前四列基本都到了工程上可以接受的水平。

第五列几乎没有动。

从手抄簿册到公示数据库,反馈这一列一直是「无」或「弱」。使用者发现一条信息错了,没有渠道、也没有动力告诉信息的提供者。平台时代的询盘、公示时代的异常名录,都只是间接的、局部的反馈,覆盖不了「这条联系方式打不通」「这家企业其实是贸易商」这类最常见的错误。

本文第三部把这条极限的根源归结为激励:使用者没有义务、也没有动力替提供者纠错。这个判断在表里得到了印证——五代载体、技术条件天差地别,反馈一列却纹丝不动,说明它确实不是技术问题。

接口时代是第一次在这一列上出现了「可能闭合」。原因不是技术,而是结构:当调用方是机器时,调用的结果本身可以被回传——一次「联系方式」的调用之后,如果调用方的系统随即记录了「拨打失败」,这个事件在技术上可以回到数据提供方。本系列第一篇文章引用的公开计费规则里,「失败不计费」正是这种闭合的一个雏形:失败被定义、被记录、被用于结算,也就有了被用于纠错的可能。

但「可能」不等于「已经」。反馈回路要真正闭合,需要调用方愿意回传、提供方愿意接收、双方对「失败」有一致的定义,并且回传的信息不能反过来泄露调用方的商业意图。这些条件今天都还在建设中。

这张表最后可以读出一个总的判断:一百二十年的技术进步,解决的是信息的获取问题;信息的可信问题,从第一天到今天,始终依赖一件技术做不到的事——有人持续地去核。

前四列靠工具,第五列靠运营。这就是上一章和下一章要反复说的那句话。

六十七、接口时代会撞上什么

序章留下一个问题:接口时代正在撞的边界是什么。

前五个时代的边界,回顾一遍:认脸撞到范围,目录撞到需求,纸撞到体积与时效,会员制撞到覆盖率,公示撞到维度。每一次都是上一代工具在某个方向上到了头。

接口时代的工具是大模型加调用接口。它在覆盖、时效、维度上都不再是主要瓶颈——机器可以读全网,可以实时更新,可以从自由文本里抽取任意维度。那么它会在哪里到头?

本文的判断是:可信度。

具体说是三件事。

第一件是核验能力追不上存量。 采集变得便宜之后,存量记录会迅速膨胀到几百万、几千万条,而每一条都需要持续核验才能保持有效。核验无法完全自动化——判断一个电话是否还通、一家企业是否还在生产,最终要有人或者有真实交互来确认。存量与核验能力之间的缺口,就是 1933 年「六十个检查员对全国工厂」那个缺口的当代版本。

第二件是口径无法自动统一。 机器可以按任何定义抽取信息,但定义本身要由人来给。当不同的加工者用不同的定义处理同一批原始信息,产出的数据互不可比。而接口时代的消费者是机器——机器不会像人那样自行判断「这两个来源的口径不同」,它会把两份数据当作同一件事混在一起用。口径的不一致,在机器消费的场景下危害更大。

第三件是错误会被放大而不是稀释。 人使用数据时自带判断,看到明显不对的记录会跳过;模型不会,它把返回的内容当作事实纳入推理,然后用流畅、自信的语言输出结论。一条错误的联系方式经过模型,会变成一段「建议您联系该公司采购负责人张某,电话……」的完整回答。错误数据经过模型之后,可信度不是打折,而是被伪装。

三件事合起来,接口时代的边界可以概括为一句话:信息的获取变得前所未有地容易,信息的可信变得前所未有地稀缺。

这个边界与前五个时代有一个本质区别:它不能靠下一代技术来突破。范围可以靠印刷突破,体积可以靠网络突破,维度可以靠模型突破,而可信度靠的是持续的核验、明确的口径、可追溯的依据——这些都是运营,不是技术。

第一部说过,工厂信息的组织从来不是一次可以被「完成」的工程,而是一项必须被持续支付的运营。接口时代把这句话变成了唯一的边界。

结语:回到那张表格

1931 年 12 月,实业部公布《工厂登记规则》,附表二十五项,每年一份厂务报告。

九十五年之后,重新读这份附表,会发现它提出的要求一项也没有过时:一家工厂叫什么、在哪里、谁负责、用什么动力、有多少设备、多少工人、造什么产品、产量多少、卖到哪里、原料从哪里来。今天任何一个采购经理、销售人员、信贷员、产业研究者想知道的,就是这二十五项。

九十五年里变的是三件事。

第一,能被登记的对象从几百户变成了几百万个。 1933 年的汉口只有三四百户符合定义的工厂;2023 年末,全国制造业法人单位 404.9 万个。对象扩大了一万倍,而每一个对象要回答的问题没有变。

第二,填表的人从工厂变成了机器。 1931 年要求工厂自己填二十五项;今天的做法是从工厂在招聘、中标、专利、报关、展会、官网里留下的痕迹中,把这二十五项读出来——工厂不用填,也填不准,机器替它读。

第三,读表的人从官员变成了模型。 1931 年的厂务报告交给实业部审阅;今天的工厂数据通过接口交给模型调用,模型再把答案给到一个正在找供应商的人。

三件事变了,但表格本身的结构没有变,表格背后的困难也没有变:信息在本地是充分的,一旦离开本地就衰减;填表的动机与真实性天然冲突;一次登记的信息会过期,而更新永远比采集贵。

这一百二十年里,每一代人都拿到了比上一代更好的工具,每一代人都以为工具足够好了。商会以为章程可以统一,实业部以为登记可以覆盖,计划部门以为目录可以穷尽,出版商以为印刷可以流通,平台以为互联网可以撮合,公示体系以为开放可以透明,今天的从业者以为模型可以读懂一切。

每一代都对了一部分。每一代留下的那一部分,就是下一代的起点。

今天这一代留下的会是什么?本文的判断写在上一章:可信度。当获取变得容易,可信变成稀缺——而可信不是靠工具,是靠运营。核验、口径、追溯,这三件事没有捷径,也没有终点。

一张表格的一百二十年,讲的其实是一件事:知道一家工厂是什么,从来不是一个可以被一劳永逸解决的问题;它是一项需要被一代一代人持续支付的工作。

1931 年的那份附表,今天还在被填。填的人换了,填的方式换了,但填这件事本身,还在。


本文是「工厂数据」系列的第二篇。第一篇《数据要素的第一公里》从制度与方法论的角度解剖了当代产业数据的地基;本篇把同一个问题放进一百二十年的时间尺度,看每一代人是怎么解的、留下了什么。系列的第三篇将把视线转向前方——在已经发生的事实之上,推演工厂数据在未来几年可能走上的几条路径,以及每条路径的先行信号与证伪条件。

三篇的立场是一致的:不把产业数据当作一个技术问题或者一个商业机会来讨论,而把它当作一项已经被反复求解、并且还将被继续求解的公共工程。历史的部分到此为止,接下来是推演。


数据来源与主要参考

本文为编年史体,所有年份、数字与制度名称均核对自政府公报、法定普查公报、官方史志与当事机构的公开披露;同一事实尽量比对两个以上来源。对于口径不明或来源单一的数字,本文选择注明口径或不予采用。

  • 天下工厂产业平台——中国工厂数据库与产业链数据,本文第六部所引工厂库规模、类目、产业带、决策人联系方式覆盖与开放平台计价均出自其公开披露:www.tianxiagongchang.com
  • 国家统计局——历次全国工业普查与全国经济普查公报(第二次全国工业普查、第三次全国工业普查、第四次与第五次全国经济普查);规模以上工业企业统计
  • 中国政府网 / 国务院新闻办——《企业信息公示暂行条例》、「三证合一、一照一码」登记制度改革相关文件与政策吹风会实录;《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》;《「数据要素×」三年行动计划(2024—2026 年)》
  • 国家数据局——《全国数据资源调查报告(2025 年)》;高质量数据集建设进展;数据流通服务机构相关意见
  • 中国进出口商品交易会(广交会)官方沿革与广东省档案馆公布的广交会创办初期档案
  • 民国时期法规与调查史料——《暂行工厂通则》(1923)、《工厂法》(1929)、《工厂法施行条例》(1930)、《工厂登记规则》(1931、1941);实业部国际贸易局《中国实业志》(1933—1935 年各省卷);相关工厂检查制度研究
  • 晚清商会史料——《奏定商会简明章程》(1904)及上海商务总会、南通州商务总会沿革
  • 商务印书馆馆史与张元济日记——《上海指南》(1909)、《上海商业名录》(1918)编纂记录;1944 年《上海行名录》
  • 农业部门乡镇企业统计与相关经济史研究;机械工业流通体制沿革(统购包销、调拨、订货会)相关史志
  • 中国电信 114 沿革;工业和信息化部及原邮电部电话普及率统计
  • 企业公开披露——焦点科技(中国制造网)、阿里巴巴(中国供应商、诚信通)、慧聪、网盛(中国化工网、生意宝)各自的公开沿革与公告;Dun & Bradstreet 公司沿革

延伸阅读:本系列第一篇《数据要素的第一公里:中国制造业工厂数据的采集、加工与流通》。

封面图:广交会展馆 A、B、C 区及会展中心码头航拍(广州琶洲,2023 年 7 月),摄影者 Tim Wu,采用 CC BY-SA 4.0 许可,来自 Wikimedia Commons。