ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

《花间集》数据集深度解析:五代文人词 JSON 数据格式、文件组织与加载实践(chinese-poetry 仓库)

《花间集》数据集深度解析:五代文人词 JSON 数据格式、文件组织与加载实践(chinese-poetry 仓库) 数据集【免费下载链接】chinese-poetryThe most comprehensive database of Chinese poetry 最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人21050首词。项目地址https://gitcode.com/gh_mirrors/ch/chinese-poetry点击查看免费下载《花间集》是中国文学史上第一部文人词选集也是 chinese-poetry 仓库「五代诗词」板块的核心数据集之一。本文以 五代诗词/huajianji/README.md 为骨架结合仓库内实际 JSON 文件、数据加载器 与 数据集配置 的源码实现系统讲解《花间集》的文本数据组织方式、字段语义、分卷文件结构以及如何用官方 loader 一次性提取全本 498 首词并接入自己的诗词应用。《花间集》第一部文人词选集与五代词史坐标《花间集》编纂于中国五代十国时期由后蜀人赵崇祚字弘基编辑是文学史上第一部文人词选集。原书收录温庭筠、韦庄等 18 位花间词派诗人的经典作品集中而典型地反映了早期词史上文人词创作的主体取向、审美情趣、体貌风格和艺术成就。在 chinese-poetry 仓库中《花间集》与《南唐二主词》并列为「五代诗词」的两大数据集五代诗词/huajianji —— 本文主角《花间集》全本数据五代诗词/nantang —— 南唐中主李璟、后主李煜的词作合集。仓库根 README.md 的「数据集」列表也把「五代·花间集」单列为一个正式数据子集与全唐诗、全宋词、论语、诗经等并列说明它在本仓库中是独立成册、可直接消费的一级数据源。数据形式分卷 JSON 与统一字段结构《花间集》数据分布在目录下的 11 个 JSON 文件中命名规则为花间集卷第一至花间集卷第十的对应英文卷号文件另加一个前置序言文件文件内容huajianji-0-preface.json欧阳炯所作《花间集序》含注释huajianji-1-juan.json~huajianji-9-juan.json原书卷一至卷九词作huajianji-x-juan.json补卷含毛熙震、孙光宪等词作每份词作 JSON 是一个对象数组单个对象包含 5 个字段以卷一首词温庭筠《菩萨蛮 其一》为例[ { title: 菩萨蛮 其一, paragraphs: [ 小山重叠金明灭鬓云欲度香腮雪。, 懒起画蛾眉弄妆梳洗迟。, 照花前后镜花面交相映。, 新帖绣罗襦双双金鹧鸪。 ], author: 温庭筠, rhythmic: 菩萨蛮, notes: [ 1.小山--写女子的隔夜残妆。小山女子画眉的式样之一。小山重叠眉晕褪色。金额黄在额上涂黄色。金明灭褪色的额黄明暗不匀。, 2.鬓云欲度--鬓发撩乱如云低垂下来。香腮雪洁白如雪的香腮。, 3.照花--对镜簪花。用前镜、后镜对照以瞻顾后影。, 4.双双--罗襦上用金线绣的成双的鹧鸪鸟。反衬自身孤独。 ] } ]各字段语义如下title词的标题常为「词牌 序号」或「词牌 首句」组合如菩萨蛮 其一、河渎神·铜鼓赛神来是全词在书中的定位标识paragraphs词的正文按阙片拆分为字符串数组是渲染词作正文的权威字段也是官方 loader 提取的默认目标字段author作者名如「温庭筠」「韦庄」rhythmic词牌名如「菩萨蛮」「浣溪沙」是词作分类与检索的核心维度notes逐句注文数组每项以「序号.关键词--释义」开头承载古籍注释信息如「1.小山--写女子的隔夜残妆」。序言文件 huajianji-0-preface.json 结构略有不同它没有paragraphs多段正文而是把欧阳炯《花间集序》全文放入单元素paragraphs并配 27 条注释含「大蜀广政三年——相当公元940年」等考据author为赵崇祚rhythmic为「花间集」。读取序言时需要注意这一结构差异。全本统计498 首词、19 位作者、78 个词牌对 五代诗词/huajianji 目录下全部 JSON 做一次聚合统计可以还原这部选集的规模全貌全本共498 首词涉及19 位作者README 所称「18 位词人」之外序言作者赵崇祚也出现在数据中使用78 个不同词牌。作品量领先的作者与词牌来自仓库实际数据统计排名作者词作数词牌词作数1温庭筠66浣溪沙562孙光宪61菩萨蛮413顾敻54酒泉子264韦庄48临江仙265李珣37女冠子19温庭筠66 首、韦庄48 首居前与文学史上「温韦」并称、为花间派主将的定位完全吻合词牌维度上「浣溪沙」「菩萨蛮」合计近 100 首是花间词人最偏爱的两类小令数据本身即可支撑词史研究中的风格统计。数据去重说明与全唐诗、全宋词可能重复五代诗词/huajianji/README.md 的「注意」一节明确指出本目录数据保存了所有的花间集数据诗词由于五代十国朝代的原因可能与全唐诗和全宋词的诗词重复。这是正常的。即同一首词可能同时出现在本目录、全唐诗 与 宋词 数据集中。原因在于五代十国时期作者如温庭筠的作品在《全唐诗》《全宋词》的编纂口径中也被收录各文集边界本就交叉。在构建跨数据集检索、去重或作者作品全景图谱时应把author title或author rhythmic 首句组合作为关联键主动做归一化处理宋词/UpdateCi.py 这类清洗脚本在合并多源词作时也需要考虑同样的重复问题。官方加载器用 PlainDataLoader 一键提取全本《花间集》不仅是独立的 JSON 目录还作为官方数据集注册进了仓库的加载器配置 loader/datas.jsonwudai-huajianji: { name: 五代-花间集, id: 0, path: 五代诗词/huajianji/, excludes: [README.md], tag: paragraphs }path指向数据集目录excludes排除README.md等非数据文件tag: paragraphs指明从每条记录中提取paragraphs字段作为正文。loader/data_loader.py 的PlainDataLoader据此实现了统一加载逻辑当path是目录时遍历目录内全部 JSON跳过excludes命中的文件把每条记录的tag字段拼接成一个大列表返回当path指向单文件时直接读取。对《花间集》而言最终得到的就是全本 498 首词的正文数组。加载器自带的演示入口loader/data_loader.py给出了最直接的调用方式from loader.data_loader import PlainDataLoader loader PlainDataLoader() # 默认读取 ./loader/datas.json print(loader.id_table) # id - 数据集名 映射 # 提取《花间集》全部正文末尾一条即补卷中的词作 print(loader.body_extractor(wudai-huajianji)[-1]) # 合并五代两大数据集花间集 南唐二主词 print(len(loader.extract_from_multiple([wudai-huajianji, wudai-nantang]))) # 按数据集 id 批量提取 print(loader.extract_with_ids([0, 1, 2]))以上代码需要在仓库根目录下运行PlainDataLoader默认配置路径为./loader/datas.json且datas.json中cp_path为./运行环境需具备 Python 3 与requests/json标准库即可。extract_with_ids([0, 1, 2])会依次取出「花间集、南唐二主词、元曲」三个数据集的正文体现了同一套加载器跨数据集复用的设计。数据校验JSON 合法性由测试脚本兜底仓库根目录的 test_poetry.py 提供了针对所有数据目录的 JSON 校验机制它遍历仓库中所有含中文名称的目录is_book_directory判断对每个目录内的.json文件执行json.loads解析test_poetry.py任一文件解析失败即断言失败。五代诗词/huajianji同样处于该校验范围之内因此全部分卷文件含序言与补卷的 JSON 合法性是有测试兜底的——这意味着你可以放心地以标准json.load()直接消费这些文件而不必担心文件级格式损坏。实战把《花间集》接入你的诗词应用综合以上数据与源码接入《花间集》的最小可行流程如下定位数据读取 五代诗词/huajianji 目录下的 10 个卷文件跳过README.md或直接使用官方 loader 的wudai-huajianji数据集按卷或全本加载json.load()逐文件读取得到[{title, paragraphs, author, rhythmic, notes}, ...]数组结构化入库以rhythmic词牌、author作者建索引paragraphs用\n.join()还原全文notes保留为逐句注文去重处理若同时接入 全唐诗 与 宋词按「作者 词牌 首句」关联键去重规避五代作品跨集重复渲染展示词牌、序数、正文分段阙天然适配列表页与详情页的卡片式布局。例如加载并渲染温庭筠《菩萨蛮 其一》的代码片段import json with open(五代诗词/huajianji/huajianji-1-juan.json, encodingutf-8) as f: poems json.load(f) first poems[0] print(first[rhythmic], first[title], first[author]) # 菩萨蛮 菩萨蛮 其一 温庭筠 print(\n.join(first[paragraphs])) # 正文按阙分行依托 README.md 描述的「JSON 格式分发、方便快速构建诗词类应用」的设计初衷《花间集》数据在诗词查询、词牌统计、作者作品集、风格分析、诗词生成等场景中都能直接落地。对五代词研究而言这份数据更是把「第一部文人词选集」从纸面文献变成了可编程、可统计、可检索的结构化资产。赞分享数据集【免费下载链接】chinese-poetryThe most comprehensive database of Chinese poetry 最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人21050首词。项目地址https://gitcode.com/gh_mirrors/ch/chinese-poetry点击查看免费下载相关推荐Redux-Beacon高级技巧使用combine-events和debounce-event优化事件流Redux Beacon高级技巧使用combine events和debounce event优化事件流 Redux Beacon是一款强大的Redux和ng【亲测免费】 chinese-poetry构建古文诗词数据集和机器学习的数据宝库chinese poetry构建古文诗词数据集和机器学习的数据宝库 项目介绍 chinese poetry 是一个开源的中文诗歌古典文集数据集旨在为研究者和数据集NLPFlair 文本分类数据格式解析AG_NEWS 数据集的 FastText 格式与加载实战Flair 文本分类数据格式解析AG_NEWS 数据集的 FastText 格式与加载实战 AG_NEWSAGs News Topic ClassificNLP深度学习机器学习上一篇Windows平台5分钟搭建RTMP直播服务器nginx-rtmp-win32终极教程下一篇如何通过Secretive安全培训认证验证团队安全管理能力的完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表