
一、介绍在最新的GPT-6中其强大的功能让大家感觉它又行了。GPT6之所以强大是因为它采用了两项新技术即自发符号建模和循环深度技术。这两项技术可以认为是AI技术发展过程中的一项重要突破。本文将重点分析一下其中的循环深度技术指出其内在的运行机制并加以分析说明。二、循环深度技术循环深度技术Recurrent Depth或loop transformers。它是大模型技术中一项新的推理架构。即通过参数共享的循环迭代机制在不增加参数量的前提下大幅提升模型的有效推理深度。其本质是利用时间换深度。它一般分为三个部分预处理层以少量的Transforemr层将输入数据映射到隐藏空间为后续的循环计算做准备循环模块是一个可反复执行的共享模块它们共享同一套参数每迭代一轮则更新一次隐藏的状态输出层在循环结束后通过少量的层将最终的解码并输出相关的结果常见的主流技术有循环TransformerLooped Transformer。让隐藏状态走完一整组Transformer层后直接回到层的起点再跑一轮循环深度TransformerRecurrent-Depth Transformer。独立设计相关的轻量核心循环块预处理和输出层只做嵌入和解码循环块可独立控制迭代次数混合递归结合混合专家MoE架构循环块内集成动态路由的专家子模块不同任务自动选择不同专家组合迭代进一步提升算力效率三、区别loop engineering在前面分析过循环工程它是在Agent上应用的。不过它和循环深度技术长得有点相似所以拿出来专门对比一下应用层面不同循环深度技术是在大模型内部使用的是一种模型架构推理机制应用在底层算法上而循环工程则在Agent上应用是一种应用层的技术它处理与大模型交互的机制循环的目标不同循环深度技术循环的是模型内部的计算层而循环工程循环的则是Agent中的应用工作流。一内一外互相配合解决的问题不同循环深度技术的循环是为了大模型利用更少的参数实现更强的推理而循环工程则是为了实现Agent应用的自动化机制优化的目标不同循环深度技术优化的大模型的计算能力和效率而循环工程则提高的是工作效率重点是自动化循环深度技术和循环工程其实可以看作是大模型和Agent应用的一种选择性配合。前者通过循环深度技术让大模型学会反复深度思考的能力而循环工程则让模型可以让大模型运行时不需要过多的人工干预跑得更有效率。四、分析说明循环深度技术由于在内部的循环处理即在Transfermor层形成一个专有的模块反复执行多次从依赖深度到依赖迭代参数不增加。此时内存的需求量开始被压缩包括参数的减少等有些测试场景下内存减少了四分之三这对于当下内存价格疯涨来说还是非常有价值的。由于可以反复自循环这样它就可以进行一些更加抽象的思考此时更接近于人类的的大脑的想法特别是对那些很难用语言描述的推理过程想想沟通成本就明白了。这也可以称谓潜在空间推理。由于其在模型内部循环不与外部打交道所以其更节约Token。但这不意味着节省算力所以GPT6价格并不低。它有点类似于人类的直觉判断这样就可以摆脱语言描述的瓶颈。典型的如多跳推理非常有用比如从A可推出B从B可推出C而是否从A可推出C这对于循环深度技术就拥有了强大的优势系统性泛化和组合泛化。另外深度外推也是一个重要的机制它在训练时推理的层次比实际推理时的推理的层次要小很多这就需要推理层依赖规则继续外推。这就意味着循环深度技术的外沿扩展能力的大幅提高。所以循环深度技术的优势非常明显首先就是极低的参数成本。在参数几乎不增长的前提下获得更大的推理深度降低了内存的占用和训练成本其次还可以根据算力进行动态分配管理根据任务的情况进行循环次数的控制。它特别适合隐式推理的场景即不需要和用户进行反复的文字沟通如代码测试或数学证明等需要反复迭代的情况。当然缺点也相对明显。循环深度技术由于在模型内进行“思考”不与外界进行交互无法进行监督。这就导致大模型的工作不透明、不可控。这意味着隐患风险的放大比如幻觉可能更真实。这和人类的直觉不一定能靠得住的原因是一样的都没有理性的推理过程。这就对AI和大模型的相关监管机制可能提出了更高的要求。另外其对硬件要求也相对较高训练稳定性还需要进一步的验证特别是反复循环有可能带来的计算冗余问题目前仍然无法解决。其实结合前面对JEV的分析可以发现大模型的发展正从混合在一起狂堆层正在朝着专业模块的拆分方向发展。JEV拆出判断模块而循环深度技术拆出了思考模块。有没有看到类似软件工程的发展的苗头毕竟大模型也是软件其设计思想是保持一致的。五、总结技术的发展就是在不断的自我否定和自我革新的前提下不断进行的。没有任何一项技术一出现就可以把前面的所有的技术都推翻它需要一个循徐渐进的过程。AI大模型也是如此和前面的区块链一样它内部的技术风起云涌几乎每天都在变化新名词术语满天飞。不过不要想得太多这才是机会。