在维基百科(Wikipedia)迎来 25 周年之际,维基媒体基金会宣布,亚马逊、微软、Meta、Mistral AI 以及 Perplexity 等多家 AI 大厂加入 “维基媒体企业合作伙伴计划”(Wikimedia Enterprise)。
这意味着,这些公司将付费获取维基百科的 企业级数据访问权,以结构化形式使用其海量内容,用于 AI 模型训练和商业应用。授权费用将直接支持维基媒体基金会的长期运营。简而言之,维基百科将其数据整理为 AI 更易理解的形式,让厂商可以“即拿即用”。
为何 AI 大厂愿意付费?
在 AI 大模型训练中,结构化数据因其清晰、一致和高效,成为模型可靠性和可扩展性的关键。维基百科过去面临的困境是:AI 爬虫频繁抓取内容,消耗大量带宽,降低了志愿者创作积极性,甚至影响捐赠。
AI 厂商付费,是为了确保维基百科的长期稳定运行。AI 行业面临悖论:模型想变得更智能,但缺乏外部高质量数据就无法进化。与其继续单方面索取,不如通过付费获取可靠数据,保证训练资源可持续。
AI 模型仍需人类智慧
当前大模型核心技术 基于人类反馈的强化学习(RLHF),需要大量高质量数据和标注。尽管部分团队尝试“自我博弈”(Self-Play)实现无数据自我进化,但缺乏外部标准答案意味着耗费算力巨大,效率低下。
因此,付费使用维基百科的数据不仅经济高效,也让 AI 厂商可以把更多资源用于算法升级和模型优化,而非去“白嫖”内容平台。
总之,AI 与高质量内容平台的合作正在重塑行业生态,维基百科的内容不仅是知识宝库,也成为 AI 可持续发展的关键资源。



