维基百科全部词条数据快速批量下载

如果在需要批量获取维基百科页面数据的时候,如果还用爬虫抓取那就太慢了,我们可以使用维基百科官方导出数据。

打开

https://dumps.wikimedia.org/other/enterprise_html/runs/

选择最新的日期目录,然后选择你的需要的语言,我们这里以中文为例 zhwiki-NS0-20240820-ENTERPRISE-HTML.json.tar.gz ,下载下来27.4个gb ,解压后193gb,你也可以找一个更小的测试。

解压 tar -xvzf zhwiki-NS0-20240820-ENTERPRISE-HTML.json.tar.gz

里面会有大量2gb一个的zhwiki_namespace_0_0.ndjson 格式的文件,每一行都是一个json,json里面有词条名、词条文本、词条html等。

json数据样例:

如果要做文字语义数据这些,有wikitext、categories,也可以用 article_body.html 直接生成离线本地的版本。

如果要生成离线html版本,需要处理一下里面的html,有一个 base 要改成你本地的,然后再把里面的css复制到本地。

另外大部分的词条原始文本都是繁体,里面还有一些用词不一样,可以使用 github.com/BYVoid/OpenCC 进行处理。