8.2万亿 tokens训练数据揭秘:A.X-K2的多阶段课程学习策略
【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2
A.X K2是SK Telecom开发的大型混合专家(Mixture-of-Experts, MoE)语言模型,作为高性能的智能基础模型,其拥有6880亿总参数和330亿活跃参数,通过创新的多阶段课程学习策略在8.2万亿tokens的海量数据上训练而成,实现了强大的推理能力和指令遵循性能。
模型架构概览
A.X K2采用 decoder-only Transformer 架构,结合了多项创新技术,使其在保持高性能的同时兼顾推理效率。
A.X K2 模型标志,体现了其作为下一代AI模型的前沿定位
核心架构特点包括:
- 混合专家机制:256个路由专家+1个共享专家,每个token激活8个专家
- 稀疏门控注意力(SGA):通过轻量级索引器选择top-k token,大幅降低长上下文计算量
- 门控归一化(GN):在RMSNorm后应用输入相关门控,抑制异常激活,提升训练稳定性和低精度服务性能
- 原生FP8训练:采用MXFP8(E4M3)格式进行前向和反向传播训练,释放内存空间
多阶段课程学习策略详解
A.X K2的训练数据经过精心设计的三阶段课程学习策略,总训练量达到8.2万亿tokens,每个阶段针对不同能力维度进行优化:
第一阶段:6.4万亿通用知识积累
- 数据构成:以网页文本、书籍、学术论文为主
- 语言分布:英语72.7%、韩语15.4%、代码8.3%,其余为日语、西班牙语和中文
- 主要来源:包括Nvidia Nemotron-CC-v2.1、FineWeb2等公共数据集,以及SKT内部爬取的韩语数据
- 训练目标:构建广泛的世界知识基础,培养基本语言理解能力
第二阶段:1.4万亿高质量推理训练
- 数据特点:精选推理密集型内容,包括数学问题、科学知识、逻辑推理任务
- 训练重点:强化多步推理能力,培养复杂问题解决技巧
- 质量控制:通过启发式和基于模型的质量过滤,结合去重和领域感知混合策略
第三阶段:0.36万亿长上下文扩展
- 数据特性:专注于超长文本序列,支持原生128K上下文长度,通过YaRN扩展至256K
- 技术突破:采用Adjusted Base Frequency (ABF)技术优化长序列训练
- 能力提升:显著增强长文档理解、多跳追踪和远距离事实检索能力
数据处理与质量保障
为确保训练数据的高质量和多样性,A.X K2采用了严格的数据处理流程:
- 数据筛选:从约16.2万亿tokens的候选池中精选8.2万亿tokens用于训练
- 质量控制:应用领域特定质量阈值,而非全局标准,随训练进展逐步提高标准
- PII处理:内部收集的语料通过PII masking管道,将检测到的标识符替换为类型特定的占位符令牌
- 数据溯源:记录每个语料库的来源和收集方法,确保符合许可要求和使用范围
训练成果与性能表现
通过精心设计的多阶段课程学习策略,A.X K2在各项评估中表现卓越:
- 数学推理:在AIME26 benchmark上达到97.1%的准确率,Apex-shortlist任务准确率88.6%
- 韩语能力:KMMLU-Pro获得80.5%的分数,CLIcK任务达到91.6%的准确率
- 长上下文理解:在RULER评估中,256K上下文长度下仍保持86.6%的性能
- 事实检索:在Needle-in-a-Haystack测试中,256K和512K上下文长度下实现100%的精确检索率
A.X K2在256K上下文长度下的NIAH事实检索性能,即使在NVFP4量化下也能实现100%准确率
实际应用与部署
A.X K2提供灵活的部署选项,支持不同场景需求:
- 思考模式:生成带推理步骤的详细响应,适用于复杂问题解决
- 非思考模式:生成简洁直接的回答,优化低延迟使用
- 部署要求:FP8权重约647 GiB,建议至少800 GiB GPU内存
- 支持框架:原生支持Hugging Face Transformers和vLLM(通过SKT-AI fork)
要开始使用A.X K2,可通过以下命令克隆仓库:
git clone https://gitcode.com/hf_mirrors/skt/A.X-K2A.X K2的多阶段课程学习策略展示了大规模语言模型训练的先进方法,通过精心设计的训练数据和创新架构,为用户提供了强大而高效的AI能力,特别在数学推理、韩语理解和长上下文处理方面表现突出。随着开源社区的进一步探索和应用,A.X K2有望在更多领域发挥重要作用。
【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考