ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

8.2万亿 tokens训练数据揭秘:A.X-K2的多阶段课程学习策略

8.2万亿 tokens训练数据揭秘:A.X-K2的多阶段课程学习策略

8.2万亿 tokens训练数据揭秘:A.X-K2的多阶段课程学习策略

【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2

A.X K2是SK Telecom开发的大型混合专家(Mixture-of-Experts, MoE)语言模型,作为高性能的智能基础模型,其拥有6880亿总参数和330亿活跃参数,通过创新的多阶段课程学习策略在8.2万亿tokens的海量数据上训练而成,实现了强大的推理能力和指令遵循性能。

模型架构概览

A.X K2采用 decoder-only Transformer 架构,结合了多项创新技术,使其在保持高性能的同时兼顾推理效率。

A.X K2 模型标志,体现了其作为下一代AI模型的前沿定位

核心架构特点包括:

  • 混合专家机制:256个路由专家+1个共享专家,每个token激活8个专家
  • 稀疏门控注意力(SGA):通过轻量级索引器选择top-k token,大幅降低长上下文计算量
  • 门控归一化(GN):在RMSNorm后应用输入相关门控,抑制异常激活,提升训练稳定性和低精度服务性能
  • 原生FP8训练:采用MXFP8(E4M3)格式进行前向和反向传播训练,释放内存空间

多阶段课程学习策略详解

A.X K2的训练数据经过精心设计的三阶段课程学习策略,总训练量达到8.2万亿tokens,每个阶段针对不同能力维度进行优化:

第一阶段:6.4万亿通用知识积累
  • 数据构成:以网页文本、书籍、学术论文为主
  • 语言分布:英语72.7%、韩语15.4%、代码8.3%,其余为日语、西班牙语和中文
  • 主要来源:包括Nvidia Nemotron-CC-v2.1、FineWeb2等公共数据集,以及SKT内部爬取的韩语数据
  • 训练目标:构建广泛的世界知识基础,培养基本语言理解能力
第二阶段:1.4万亿高质量推理训练
  • 数据特点:精选推理密集型内容,包括数学问题、科学知识、逻辑推理任务
  • 训练重点:强化多步推理能力,培养复杂问题解决技巧
  • 质量控制:通过启发式和基于模型的质量过滤,结合去重和领域感知混合策略
第三阶段:0.36万亿长上下文扩展
  • 数据特性:专注于超长文本序列,支持原生128K上下文长度,通过YaRN扩展至256K
  • 技术突破:采用Adjusted Base Frequency (ABF)技术优化长序列训练
  • 能力提升:显著增强长文档理解、多跳追踪和远距离事实检索能力

数据处理与质量保障

为确保训练数据的高质量和多样性,A.X K2采用了严格的数据处理流程:

  1. 数据筛选:从约16.2万亿tokens的候选池中精选8.2万亿tokens用于训练
  2. 质量控制:应用领域特定质量阈值,而非全局标准,随训练进展逐步提高标准
  3. PII处理:内部收集的语料通过PII masking管道,将检测到的标识符替换为类型特定的占位符令牌
  4. 数据溯源:记录每个语料库的来源和收集方法,确保符合许可要求和使用范围

训练成果与性能表现

通过精心设计的多阶段课程学习策略,A.X K2在各项评估中表现卓越:

  • 数学推理:在AIME26 benchmark上达到97.1%的准确率,Apex-shortlist任务准确率88.6%
  • 韩语能力:KMMLU-Pro获得80.5%的分数,CLIcK任务达到91.6%的准确率
  • 长上下文理解:在RULER评估中,256K上下文长度下仍保持86.6%的性能
  • 事实检索:在Needle-in-a-Haystack测试中,256K和512K上下文长度下实现100%的精确检索率

A.X K2在256K上下文长度下的NIAH事实检索性能,即使在NVFP4量化下也能实现100%准确率

实际应用与部署

A.X K2提供灵活的部署选项,支持不同场景需求:

  • 思考模式:生成带推理步骤的详细响应,适用于复杂问题解决
  • 非思考模式:生成简洁直接的回答,优化低延迟使用
  • 部署要求:FP8权重约647 GiB,建议至少800 GiB GPU内存
  • 支持框架:原生支持Hugging Face Transformers和vLLM(通过SKT-AI fork)

要开始使用A.X K2,可通过以下命令克隆仓库:

git clone https://gitcode.com/hf_mirrors/skt/A.X-K2

A.X K2的多阶段课程学习策略展示了大规模语言模型训练的先进方法,通过精心设计的训练数据和创新架构,为用户提供了强大而高效的AI能力,特别在数学推理、韩语理解和长上下文处理方面表现突出。随着开源社区的进一步探索和应用,A.X K2有望在更多领域发挥重要作用。

【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表