(来源:大树的格局)
今天聊聊AI语料。
你想想看,现在全世界的大模型都在疯狂"吃饭",而它们吃的饭就是语料。但语料这玩意儿不是地里长出来的,它背后有一条完整的产业链,上游有人种地,中游有人做饭,下游有人吃。这条链子现在的价值分配,正在发生一场很多人还没看懂的剧变。
先说说上游那些手里有地的人——也就是版权方。过去市场给中文在线、视觉中国、中国科传这类公司估值,是按照"卖书卖报"的老黄历来算的,市盈率低得可怜,因为大家觉得你就是个出书的、拍图的,天花板看得见。
有个数据很能说明问题:高质量中文标注训练语料仅占全球主流大模型训练语料约1%,而中国AI大模型数量已占全球36%,这种结构性供需缺口直接把版权方的议价权抬到了历史高位。特别是那些手握珍贵历史档案和专业学术文献的机构,其语料单价远高于普通网络文学,这块增量利润的弹性,绝不是传统出版业务能比的。
上一篇:特朗普盯上伊朗“镐山”