中国科传:AI数据饥渴下的稀缺资产价值重估
近期一条新闻把AI数据饥渴的真相撕开:AI巨头为了抢干净的稀缺训练数据,已经把手伸向18世纪孤本植物学文献——通过ISBNdb中介匿名接单,单次采购量100万册,切掉书脊、高速扫描后直接粉碎销毁,连美国联邦法官都裁定这算"合理使用"。干净的、合规的、高质量的稀缺文字,正在成为AI时代最稀缺的资产。
这条新闻的背后,是整个AI产业链逻辑的范式切换:通用网络文本数据已被爬尽,AI公司的下一站是"稀缺数据 + 正版授权"。国内政策面已同步跟上——2026年5月深圳22家出版、传媒、版权机构签署《人工智能高质量语料库建设公约》,确立"先授权、后使用"原则。这意味着,谁手握高门槛学术资源、谁拥有正版授权话语权,谁就拿到了AI数据价值的入场券。
一、AI数据饥渴:从爬取到授权,出版业迎价值重估
AI大模型训练已经走到"数据荒"的分水岭。公网网页、新闻、小说这类低质量语料被反复爬取后,模型输出谬误频出、幻觉严重;要让模型在专业场景真正可用,必须喂入高质量、合规、可确权、可商用的稀缺语料。Anthropic挖来前谷歌图书负责人专门干古籍扫描这事,就是最直接的产业信号。
但野蛮爬取时代即将终结。2026年5月22家机构深圳签约,正版化语料库建设从理念走向行动;中国大百科全书出版社牵头,联合人民出版社、中华书局、中信出版等组建"国家级正版高质量语料库",引入区块链技术做全流程可溯源。这等于把AI语料供给的"水龙头"从AI公司手里,交到了出版社手上。
核心判断
AI公司抢数据的方式正从"匿名扫书"切换到"正版采购+授权";出版业从"卖纸书"切换到"卖数据、卖语料、卖知识服务"。这一切换中,资源壁垒越高、版权链路越完整的出版社,议价权越强。
二、产业链卡位:稀缺学术资源=AI数据端的"硬资产"
AI大模型
通用/垂直
→
语料需求
高质量/合规
→
中国科传
稀缺学术资源池
→
机构订阅
数据库/授权
中国科传是这条产业链上最稀缺的供给方之一。其前身是1954年成立的中科院科学出版社,背靠中国科学院,全国院士、科研院所重大科研成果优先在此出版,70余年独家积累形成不可复刻的学术资源池:出版期刊825种(含130种SCIE收录、117种Q1区),年发文量4万篇,图书存量超200万册。19个学科门类中13项学术影响力全国第一,A股唯一拥有大规模正版中文科研论文数据库的上市公司。
数字业务已形成完整产品矩阵:科学文库(全学科数字资源)、SciEngine(国际期刊出版与传播平台,读者覆盖200余国)、中国生物志库(10万种现生物种)、本草数典中药知识库、古生物地层知识库、细胞生物学3D资源库等。这些结构化、经过专业编辑标引的数据库,正是AI训练梦寐以求的稀缺语料。
三、业务映射:四条业务线,条条卡在AI数据风口
业务 × AI数据主题关联度
数字知识服务科学文库、SciEngine等数据库集群,是AI训练可直接调用的稀缺语料池直接相关
学术期刊运营825种期刊+130种SCIE+海外EDP,期刊论文是高质量结构化语料的核心来源直接相关
科技图书出版200万册存量+年新书3400种,学术专著是稀缺领域语料,原生版权清晰直接相关
出版物进出口跨境学术文献特许经营资质+海外渠道,稀缺外语数据进入国内的合规通路间接相关
最值得关注的是公司已自建"数据→产品"闭环:全资子公司中科数媒研发的"远至"医学大模型,成为国内首批通过国家网信办生成式人工智能服务大模型及算法"双备案"的出版类大模型,深度整合权威医学资源,推动专业知识普惠。这意味着公司不仅卖数据、卖语料,还能自己做成AI产品。2025年12月,公司再投资2亿元设立全资子公司"北京中科传媒",专门承接期刊业务的数字化、平台化运营。
四、兑现节奏:从"营收占比"看数据资产的"含金量"
| 业务/产品 | 主题关联度 | 兑现层 | 关键数据 |
|---|---|---|---|
| 数字知识服务(科学文库+生物志库等) | 直接相关 | 已落地 | 数据库业务毛利率60%+,增速常年20%以上 |
| 学术期刊运营(825种期刊) | 直接相关 | 已变现 | 2025年期刊业务营收+18.37%,四大业务中增速最高 |
| "远至"医学大模型(双备案) | 直接相关 | 商业化中 | 国内首批出版类大模型双备案,含百姓版/医生版/机构版 |
| 北京中科传媒(2025年12月新设) | 间接相关 | 建设中 | 2亿元注册资本,期刊数字化整合运营 |
| 科技图书出版(基础业务) | 直接相关 | 已变现 | 2025年图书业务营收10.68亿元,毛利率53.06% |
数字知识服务(数据库集群)已规模变现
学术期刊运营(825种期刊)增速最高板块
"远至"医学大模型双备案已通过,机构版推进中
AI训练语料授权变现市场未成熟,潜在增量
从财务数据看,公司2025年营收30.13亿元(+1.85%),归母净利润4.84亿元(+11.77%),利润增速持续高于营收增速;2026Q1归母净利润同比+7.90%,开局稳健。资产总额76.86亿元,资产负债率仅25%,现金充裕。传统出版基本盘贡献稳定现金流,数字知识服务、AI大模型则承担估值重估的弹性。
价值重估逻辑
过去市场把中国科传归类为传统出版传媒,估值锚在PE 20-30倍的印刷出版行业;当下游AI公司开始为"稀缺正版语料"付费时,公司的资源属性已切换为"AI数据资产运营平台",估值锚点有望从印刷出版向数据要素/数字内容迁移。这是从"卖书"到"卖数据"再到"卖AI产品"的估值三级跳。
回到开头那条新闻——马斯克紧急下令SpaceXAI无损扫描、Hedgie呼吁全行业效仿——本质都是在回答同一个问题:当干净的文字成为稀缺资产,谁掌握源头、谁拥有版权、谁能提供合规授权,谁就是AI时代的"卖水人"。中国科传手里握着的,正是中科院系独家、70余年不可复制的学术资源池,以及A股唯一的正版中文科研数据库牌照。这不是概念,是落地;不是远期,是正在兑现。
免责声明:本网站提供的所有数据及资讯(包括第三方机构提供的信息)仅作交流学习及参考用途,不构成任何投资建议或交易要约。