GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

35次阅读
没有评论

一、项目简介

GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

项目logo

chinese-poetry/chinese-poetry 是 GitHub 上热度极高、覆盖面最全的中华古典文集开源数据库,由开发者 jackeyGao 长期维护,采用 MIT 开源协议免费开放,是国内 NLP、诗词类应用开发、古典文学研究最主流的数据源。

项目初衷十分纯粹:古诗是中华文明瑰宝,但纸质古籍获取门槛高,而标准化电子版能让开发者、文学爱好者低成本复用海量诗词文本。项目从 2017 年启动,历经多年持续迭代、文字纠错、目录规范化,截至 2026 年仍在持续更新维护,累计 600 + 次代码提交,社区活跃、修复及时。

二、海量数据集:覆盖千年古典文学

仓库内置完整分类目录,全部文本统一整理为JSON 结构化格式,繁简统一、标点修正、剔除乱码,无需大量预处理即可直接使用,核心数据规模如下:

  1. 诗词类核心库
    • 全唐诗 / 御定全唐诗:5.5 万首唐诗,收录李白、杜甫、白居易等 1.4 万唐代诗人作品
    • 宋诗:26 万首宋代诗歌,陆游、苏轼、杨万里等宋代大家全集完整收录
    • 宋词:2.1 万首词作,覆盖 1.5 万宋代词人,包含《花间集》《南唐二主词》五代词
    • 元曲、纳兰性德词集、曹操诗集、水墨唐诗等细分合集
  2. 古文典籍库 楚辞、诗经、论语、四书五经、蒙学(三字经、千字文等)、《幽梦影》明清小品文,兼顾诗词与传统国学文本。

数据格式示例(JSON 标准结构)

每首诗词统一字段,包含标题、作者、正文、篇目分区等信息,适配程序读取:

json

{
  "title": "静夜思",
  "author": "李白",
  "content": "床前明月光,疑是地上霜。举头望明月,低头思故乡。"
}

所有特殊标点、异体字、生僻字均做统一修正,解决传统古籍文本乱码、格式混乱问题。

三、项目配套:词云可视化与数据加载工具

1. 多维度诗词词云分析

项目内置大量统计可视化词云,直观展现古典文学创作特征:

GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

宋词词牌词云

GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

宋词高频词

GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

唐诗作者榜

GitHub 开源宝藏:chinese-poetry—— 百万级古典诗词结构化数据集全解析

宋诗作者榜

  • 体裁维度:宋词热门词牌(浣溪沙、水调歌头、鹧鸪天等)热度分布
  • 文字维度:唐 / 宋 / 宋词高频意象(明月、春风、相思、人间等)
  • 作者维度:各朝代诗人作品总量排行,直观看出李白、杜甫、苏轼、陆游的创作体量

2. 内置 Loader 工具,快速读取数据

仓库自带loader数据加载模块,封装好读取 API,支持:

  • 单数据集抽取诗词文本
  • 多文集批量合并提取
  • 通过数据集 ID 精准加载对应典籍 无需自行解析 JSON 文件,几行代码即可批量获取百万级诗词语料,大幅降低开发门槛。

四、多元落地场景:从爱好者到 AI 开发者

该仓库是中文古典文学领域的 “万能数据源”,大量开源项目、商用产品均基于此构建:

1. 诗词类产品开发

  • 网页 / 小程序诗词检索工具:汉字之美、诗词墨客小程序、中文诗歌主页
  • 桌面 / APP 工具:诗词桌面壁纸、离线全唐诗 Android 客户端
  • 诗词日历、诗句摘抄、诗词答题小程序等轻量应用

2. AI 诗词生成、NLP 科研

是中文古典文本生成任务的标配数据集:

  • 基于 PyTorch/TensorFlow 训练 Char-RNN、Transformer 诗词生成模型,支持藏头诗、自定义意境创作
  • PaddleNLP、Qwen 大模型微调专用古文语料,训练符合平仄、对仗规则的 AI 作诗系统
  • 向量检索、诗词语义匹配、古典文学文本分类、词向量训练研究数据底座GitHub

3. 文学可视化、文史数据分析

利用数据集做朝代诗词热度、意象变迁、作者创作风格大数据分析,生成词云、热力图、时间线可视化作品,适用于文史科普、学术论文配图。

五、快速上手使用教程

1. 克隆项目

bash

运行

git clone https://github.com/chinese-poetry/chinese-poetry.git
cd chinese-poetry

所有诗词 JSON 文件存放于各文集文件夹内,直接读取即可。

2. 使用官方 Loader 加载数据

python

运行

from loader.data_loader import PlainDataLoader
# 初始化加载器
loader = PlainDataLoader()
# 提取全唐诗所有诗词
tang_poems = loader.extract_from_multiple(["全唐诗"])

3. 极简 Python 读取示例(不依赖 Loader)

python

运行

import json
# 读取单份唐诗json
with open("全唐诗/poet.tang.0.json", "r", encoding="utf-8") as f:
    poems = json.load(f)
for p in poems:
    print(p["title"], p["author"], p["content"])

六、社区贡献与开源规范

项目完全开放共建,任何人可参与完善:

  1. 提交 PR 纠错补全:修正错字、补充遗漏诗词,提交时标注古籍出处;新增古代诗文集可提交新增目录
  2. Issue 讨论规划:有争议内容、新增典籍类型由社区投票决定是否入库
  3. 资金赞助:提供爱发电、Patreon、微信 / 支付宝一次性赞助渠道,用于持续维护数据
  4. 开源协议:MIT 协议,商用、个人学习、二次分发均无限制,仅需保留原项目开源声明。

七、总结

chinese-poetry 凭借数据量大、格式规范、零成本商用、持续维护四大核心优势,成为中文古典文学数字化绕不开的开源项目。

如果你是:

  • 前端 / 小程序开发者:想做诗词查询、国风工具;
  • AI 算法工程师:训练古文生成、古典文本大模型;
  • 文史爱好者 / 学生:做诗词数据分析、可视化科普;
  • 独立开发者:开发国风、传统文化类产品;

这个仓库都能直接提供完整、干净的百万级诗词语料,省去古籍爬取、文本清洗的大量工作,是低成本实现传统文化数字化的绝佳工具。

仓库地址:https://github.com/chinese-poetry/chinese-poetry

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)
验证码