一、项目简介

项目logo
chinese-poetry/chinese-poetry 是 GitHub 上热度极高、覆盖面最全的中华古典文集开源数据库,由开发者 jackeyGao 长期维护,采用 MIT 开源协议免费开放,是国内 NLP、诗词类应用开发、古典文学研究最主流的数据源。
项目初衷十分纯粹:古诗是中华文明瑰宝,但纸质古籍获取门槛高,而标准化电子版能让开发者、文学爱好者低成本复用海量诗词文本。项目从 2017 年启动,历经多年持续迭代、文字纠错、目录规范化,截至 2026 年仍在持续更新维护,累计 600 + 次代码提交,社区活跃、修复及时。
二、海量数据集:覆盖千年古典文学
仓库内置完整分类目录,全部文本统一整理为JSON 结构化格式,繁简统一、标点修正、剔除乱码,无需大量预处理即可直接使用,核心数据规模如下:
- 诗词类核心库
- 全唐诗 / 御定全唐诗:5.5 万首唐诗,收录李白、杜甫、白居易等 1.4 万唐代诗人作品
- 宋诗:26 万首宋代诗歌,陆游、苏轼、杨万里等宋代大家全集完整收录
- 宋词:2.1 万首词作,覆盖 1.5 万宋代词人,包含《花间集》《南唐二主词》五代词
- 元曲、纳兰性德词集、曹操诗集、水墨唐诗等细分合集
- 古文典籍库 楚辞、诗经、论语、四书五经、蒙学(三字经、千字文等)、《幽梦影》明清小品文,兼顾诗词与传统国学文本。
数据格式示例(JSON 标准结构)
每首诗词统一字段,包含标题、作者、正文、篇目分区等信息,适配程序读取:
json
{
"title": "静夜思",
"author": "李白",
"content": "床前明月光,疑是地上霜。举头望明月,低头思故乡。"
}
所有特殊标点、异体字、生僻字均做统一修正,解决传统古籍文本乱码、格式混乱问题。
三、项目配套:词云可视化与数据加载工具
1. 多维度诗词词云分析
项目内置大量统计可视化词云,直观展现古典文学创作特征:

宋词词牌词云

宋词高频词

唐诗作者榜

宋诗作者榜
- 体裁维度:宋词热门词牌(浣溪沙、水调歌头、鹧鸪天等)热度分布
- 文字维度:唐 / 宋 / 宋词高频意象(明月、春风、相思、人间等)
- 作者维度:各朝代诗人作品总量排行,直观看出李白、杜甫、苏轼、陆游的创作体量
2. 内置 Loader 工具,快速读取数据
仓库自带loader数据加载模块,封装好读取 API,支持:
- 单数据集抽取诗词文本
- 多文集批量合并提取
- 通过数据集 ID 精准加载对应典籍 无需自行解析 JSON 文件,几行代码即可批量获取百万级诗词语料,大幅降低开发门槛。
四、多元落地场景:从爱好者到 AI 开发者
该仓库是中文古典文学领域的 “万能数据源”,大量开源项目、商用产品均基于此构建:
1. 诗词类产品开发
- 网页 / 小程序诗词检索工具:汉字之美、诗词墨客小程序、中文诗歌主页
- 桌面 / APP 工具:诗词桌面壁纸、离线全唐诗 Android 客户端
- 诗词日历、诗句摘抄、诗词答题小程序等轻量应用
2. AI 诗词生成、NLP 科研
是中文古典文本生成任务的标配数据集:
- 基于 PyTorch/TensorFlow 训练 Char-RNN、Transformer 诗词生成模型,支持藏头诗、自定义意境创作
- PaddleNLP、Qwen 大模型微调专用古文语料,训练符合平仄、对仗规则的 AI 作诗系统
- 向量检索、诗词语义匹配、古典文学文本分类、词向量训练研究数据底座GitHub
3. 文学可视化、文史数据分析
利用数据集做朝代诗词热度、意象变迁、作者创作风格大数据分析,生成词云、热力图、时间线可视化作品,适用于文史科普、学术论文配图。
五、快速上手使用教程
1. 克隆项目
bash
运行
git clone https://github.com/chinese-poetry/chinese-poetry.git
cd chinese-poetry
所有诗词 JSON 文件存放于各文集文件夹内,直接读取即可。
2. 使用官方 Loader 加载数据
python
运行
from loader.data_loader import PlainDataLoader
# 初始化加载器
loader = PlainDataLoader()
# 提取全唐诗所有诗词
tang_poems = loader.extract_from_multiple(["全唐诗"])
3. 极简 Python 读取示例(不依赖 Loader)
python
运行
import json
# 读取单份唐诗json
with open("全唐诗/poet.tang.0.json", "r", encoding="utf-8") as f:
poems = json.load(f)
for p in poems:
print(p["title"], p["author"], p["content"])
六、社区贡献与开源规范
项目完全开放共建,任何人可参与完善:
- 提交 PR 纠错补全:修正错字、补充遗漏诗词,提交时标注古籍出处;新增古代诗文集可提交新增目录
- Issue 讨论规划:有争议内容、新增典籍类型由社区投票决定是否入库
- 资金赞助:提供爱发电、Patreon、微信 / 支付宝一次性赞助渠道,用于持续维护数据
- 开源协议:MIT 协议,商用、个人学习、二次分发均无限制,仅需保留原项目开源声明。
七、总结
chinese-poetry 凭借数据量大、格式规范、零成本商用、持续维护四大核心优势,成为中文古典文学数字化绕不开的开源项目。
如果你是:
- 前端 / 小程序开发者:想做诗词查询、国风工具;
- AI 算法工程师:训练古文生成、古典文本大模型;
- 文史爱好者 / 学生:做诗词数据分析、可视化科普;
- 独立开发者:开发国风、传统文化类产品;
这个仓库都能直接提供完整、干净的百万级诗词语料,省去古籍爬取、文本清洗的大量工作,是低成本实现传统文化数字化的绝佳工具。