
一、数据概况以大语言模型、扩散模型和多模态模型为代表的生成式人工智能正快速发展应用场景从文本生成、图像生成延伸到代码、音频与视频生成已成为人工智能技术创新的重要方向。要刻画这一领域的创新产出专利数据提供了一个直接的技术研发视角——创新主体的技术活动会沉淀在专利的申请与授权记录中。本数据库以中国专利文献信息为基础借助生成式人工智能技术关键词、IPC分类号以及专利文本语义识别三类手段对生成式人工智能相关专利进行识别与整理。数据集包含国际专利分类号、申请人与地址、申请人类型、申请日、公开公告日、授权公告日、发明人、摘要文本、主权项内容等核心字段可为企业层面与区域层面的人工智能创新研究提供数据支撑。二、专利识别与整理流程专利筛选以专利名称、摘要和第一项权利要求为主要读取对象分为两条并行路径命中任一路径即可进入后续校验路径一出现专有名称不看分类号只要文本中出现下列任一专有名称即命中生成式人工智能、生成式AI、AIGC、生成对抗网络、对抗生成网络、生成式对抗网络、生成对抗式网络、变分自编码器、变分自动编码器、扩散概率模型、去噪扩散、神经辐射场、自回归生成、生成式预训练、大语言模型、大型语言模型、ChatGPT、GPT-3 / GPT3、GPT-4 / GPT4以及英文表述 generative adversarial network、variational autoencoder、denoising diffusion、generative pre-trained / pretrained、large language model。路径二出现泛称或缩写且同时命中分类号泛称或缩写包括 GAN、VAE、LLM、GenAI、NeRF、扩散模型、自回归模型、自回归解码、生成式潜在优化以及「图像 / 文本 / 视频 / 语音 / 分子 / 代码……生成模型网络」这一句式。其中泛称「大模型」须与语言、文本、对话、提示词、预训练、多模态等同字段共现。分类号须属于以下共63个类别神经网络 G06N3 全组40个语音合成 G10L13 共10个机器学习 G06N20 共3个自然语言处理 G06F40/20、/284、/40训练样本生成 G06F18/214其余为 G06Q10/04、G06V10/70、G16H30/40、H04L51/02。同形词检查与整类排除命中则不入库• 物理扩散类扩散系数、扩散方程、扩散时间、扩散速率、扩散距离、扩散范围、扩散规律、扩散浓度、扩散半径、扩散速度、扩散趋势、气体扩散、烟气扩散、烟雾扩散、粉尘扩散、污染物扩散、污染扩散、泄漏扩散、热扩散、温度扩散、水量扩散、溶质扩散、离子扩散、菲克、高斯烟羽、大气扩散、羽流• 时序自回归类ARIMA、ARMA、GARCH、ARCH模型、自回归滑动平均、自回归移动平均、整合移动平均、差分自回归、向量自回归、VAR模型、时间序列预测、软测量• AIGC 周边全文出现 AIGC 却未出现生成、合成、创作、生产、绘制、绘图、作图、画图、生图、作画等表述• 整类排除外观设计以及标题中含增材制造、3D打印、3D打印机的文献。入库与标签通过校验的文献正式入库并同时打上两个标签。一是生成模型族生成对抗网络、变分自编码器、扩散模型、大语言模型、自回归模型、未指明模型二是生成模态文本、图像视频、语音音乐、3D模型、软件代码、分子基因蛋白、其他。两个标签均为多值一条文献可同时携带多个采用豁免优先原则只要存在一个生成式标记即不因其他命中的排除词而否决。三、数据介绍四、数据指标数据集共包含24个字段覆盖模型类型、模态、专利标识、申请人与地址、时间节点以及文本内容等维度具体如下五、数据概览历年专利申请情况下图统计了2008年至2026年8月生成式人工智能相关专利的历年申请量。可以看到2016年之前相关申请寥寥无几此后逐年攀升2021年起进入快速增长通道2024年、2025年申请量分别约为3.0万条和4.4万条规模迅速放大。注该统计按明细数据条数计、未按专利去重数据库在2008年之前无申请记录2026年数据截至8月且2025—2026年的申请量受发明专利18个月公开期影响存在偏低。图1 生成式人工智能历年专利申请情况2008—2026.8图1 生成式人工智能历年专利申请情况2008—2026.8专利明细样本数据以明细表形式组织每行对应一条专利记录字段涵盖模型类型、生成模态、专利名称、专利类型、申请人及其类型、地址与所属地区、申请号与日期、公开公告与授权公告信息、IPC分类号等。下表为样本部分字段的横向视图完整24个字段的清单见上一节。注样本仅为部分字段的横向视图专利名称、申请人、申请人地址等字段受列宽限制未完整显示发明人、摘要文本、主权项内容等字段未包含在视图范围内。图2 生成式人工智能专利明细样本部分字段横向视图图2 生成式人工智能专利明细样本部分字段横向视图六、应用方向专利明细数据可从企业、区域和技术三个层面支撑人工智能创新研究•企业创新画像以申请人含申请人类型、所属地区为单位统计生成式人工智能专利的申请与授权数量刻画企业、高校及科研机构的技术布局•区域创新比较按申请人地区、城市、区县汇总比较不同区域在生成式人工智能领域的创新产出与集聚程度•技术主题分析基于生成式AI模型类型与生成模态两个标签分析大语言模型、扩散模型、生成对抗网络等方向的技术演进与结构变化•文本挖掘利用摘要文本与主权项内容开展主题建模、关键词演化等技术文本分析•跨库匹配以申请人名称、申请人地区为键与工商注册、上市企业、区域经济等外部数据融合使用。数据来源国家知识产权局中国专利文献信息。顶部专栏分享更多内容经管社科数据整理与分析_Paper数据分析的博客-CSDN博客来源Paper数据分析