ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

神经编码不是AI调参数:从率失真优化到端到端学习的代际变革

神经编码不是AI调参数:从率失真优化到端到端学习的代际变革 很多朋友一听到“神经编码”第一反应就是哦AI给视频编码器调一调参数码率压得更好一点。我每次听到这种说法都有点哭笑不得。神经编码Neural Video Coding如果只是“AI调参数”那它根本配不上“下一代视频编码”这个位置因为传统编码器里的参数——量化步长、拉格朗日乘子、码率控制权重——早就被各路工程师调了几十年已经快到人工调参的极限了。神经编码真正要改变的不是参数取什么值而是整个编码框架的构建方式把“预测、变换、量化、熵编码”这些原本靠人设计的模块换成一组可以联合学习的神经网络组件把“率失真优化”这个编码器灵魂直接嵌进网络训练目标里。这篇文章适合两类人看一类是做视频编码、转码、音视频底层技术的工程师你大概能从中看清H.265/H.266之后的技术方向另一类是做AI算法但刚接触压缩领域的同学你会明白为什么在压缩任务里光会调网络结构远远不够还得先理解率失真那套“老古董”逻辑。1. 这个误会是怎么来的AI增强编码与神经编码的分界线1.1 从AI滤镜、AI降噪到“AI编码”名字像本质完全不同先说一个很容易混淆的大背景。这几年视频领域里“AI”这个词出现得特别频繁AI画质增强、AI超分、AI降噪、AI去块效应滤波……这些功能其实是在传统编码链路的外围做后处理。比如同一个码流解码出来之后再用超分模型把分辨率抬一抬或者用降噪模型把块效应抹掉本质上编码器本身没变H.265还是H.265VVC还是VVC只是在旁边加了一个AI滤镜。这一类应用做得多了之后大家就容易形成一种直觉所谓“AI编码”就是传统编码器加AI后处理或者AI自动选择编码参数。于是“神经编码AI调参数”这个说法就这么传开了。但真正的神经编码走的是完全不同的路线它不像是在传统编码器旁边加插件而是把编码器整个拆掉重盖。传统编码器有一个非常清晰的模块化流程帧内预测、帧间运动估计与补偿、变换、量化、熵编码然后环路滤波做收尾。每个模块都有明确的数学定义和人工设计的规则比如运动搜索为什么用SAD、变换为什么用DCT、量化为什么用均匀量化加deadzone。神经编码则不预设这些模块它用一个或一组神经网络替代整个编码映射关系输入端是像素输出端是重建像素中间藏着一个隐空间的压缩表示。这里有个要点神经网络并不是简单地在做“函数拟合”它是在学习一种压缩表示。图像或者视频帧经过编码网络之后变成一个低维或者高维但是紧凑的特征张量然后对这个特征张量做量化、熵编码最终由解码网络重建出图像。这个过程里原本“预测、变换、量化、熵编码”的很多环节确实还存在但它们不再是独立设计的模块而是网络的可学习组件。模块还在规则没了这就是分界线。1.2 “参数”一词在传统编码和神经网络里指的不是同一个东西再来拆一拆“参数”这个词。在传统编码里说“调参数”一般指两件事第一是编码级参数比如码率、帧率、GOP结构、QP取值、preset档位第二是算法级参数比如sao-sao的偏移量、alf滤波系数、码率控制的ABR权重。这些东西的共同点是数量有限特征明确每一个参数都对应一个可以解释的物理或数学含义而且都是人来定的。x265里的--crf 23、--preset slowVTM里的--QP 32这些都是工程师根据场景经验调出来的结果。神经网络里的参数完全不是这个逻辑。一个端到端训练的神经编码器参数量少则几千万多则上亿单个参数没有任何人工可解释性也不存在“调某个参数让画质变好”这种操作。这些参数全部是在训练阶段通过梯度反传、在大量图像/视频数据上迭代学习出来的。人工能调的是超参数比如网络层数、通道数、训练时的拉格朗日乘子、学习率、量化区间但这些超参数跟传统编码的“参数”所起的作用、所在的层级、背后的优化逻辑完全不同。所以“神经编码不是AI调参数”这个标题本质上是在纠正一个概念层级的错位。传统编码里人工调的是压缩流程的规则参数神经编码里训练出来的是压缩表示的权重参数两者唯一的共同点是都叫“参数”其他从目标函数到优化方式全部不一样。2. 传统编码的压舱石率失真优化是怎么运转的2.1 预测、变换、量化、熵编码的老框架要理解神经编码改变了什么就得出清楚传统编码到底做了什么。过去几十年H.264、H.265、H.266VVC走的都是混合编码框架整个流程可以压缩成一条链路预测去除时间和空间上的冗余。帧内预测用周围像素外推当前块帧间预测在参考帧里找最像的块算一个运动向量。预测的意义在于我们不编码原始像素编码的是“原始像素减去预测值”的残差。残差里的能量比原始像素小得多熵编码能压得更狠。变换把残差从像素域转到频域。DCT/DST这类变换能把能量集中到少数低频系数上很多高频系数趋向于零利于后续量化。量化对变换系数做有损压缩。量化步长越大系数被扔掉的信息越多码率越低失真越大。这一步是有损压缩的根源也是码率与画质的直接交汇点。熵编码对量化后的系数做无损压缩。CABAC在H.264之后一直是主流它会根据上下文模型对符号进行概率估计本质上是把信源的统计特性吃透。这个框架的厉害之处在于每个模块都有几十年的理论支撑而且模块化设计方便硬件实现。但它的问题也很明显每个模块都是单独优化的模块之间的接口由人指定的规则衔接。帧间预测只能做平移运动模型旋转、缩放、遮挡这些复杂运动就非常吃力变换是从图像统计特性里推出来的但它和后面的量化、熵编码并不联合最优量化规则在所有内容上都一样不会因为这是一张人脸还是一段纹理就自适应调整。2.2 拉格朗日乘子传统编码里真正的“参数”再说一个最容易被人忽略、但恰恰是编码器灵魂的东西率失真优化。编码器在决定“这个块用帧内还是帧间”“运动向量精度要几分之一像素”“量化步长取多少”的时候本质上都在回答同一个问题多花一些码率值不值得如果码率增加一点点画质收益很大那就值得如果画质几乎没变码率却涨了一截就不值得。这个“值不值得”被形式化成一个拉格朗日代价函数J D λ × R其中D是失真失真可以是MSE、SSE或者经过加权的主观指标R是码率λ是拉格朗日乘子。编码器所有的模式决策、运动搜索、量化步长选择本质上都是在一个巨大的候选集合里找让J最小的组合。λ越大码率的“价格”越贵编码器就越倾向于省码率、接受失真λ越小编码器就越愿意花码率换画质。这就是为什么同样是H.265同样的源视频用CRF 18和CRF 28出来的文件大小和画质天差地别。λ的设定直接决定了率失真曲线上往哪个点靠。传统编码器里那些所谓的“调参数”不管是preset还是CRF还是码率控制里的ABR系数最终都是在这一条率失真原则下折腾。2.3 为什么传统编码的参数必须靠人调既然率失真优化目标这么清晰为什么还需要人去调参数因为率失真优化的计算复杂度是天文数字编码器不可能对所有候选模式做穷举。H.265里一个CTU的划分方式就有几十上百种每种划分又要做帧内/帧间预测、变换、量化、熵编码的完整代价计算所以实际编码器必须用各种启发式规则把搜索空间砍掉一大半。这些启发式规则的质量直接决定了“在有限算力下能逼近率失真最优曲线到什么程度”。VTM比HM提升压缩率大约30%x265的slow模式比veryfast模式压缩率能高百分之二三十但付出的编码时间可能是几十倍的差距。这里的“慢”和“快”不是简单的实现优化问题而是搜索深度不同、启发性规则不同、提前终止条件不同。preset从veryslow到ultrafast本质上是逐步拿掉各种精细搜索用更“粗暴”的决策来换时间。有意思的地方来了这些启发式规则里的阈值、权重、偏置全部依赖人工的经验和大量实验。为什么帧间预测的merge模式在某些情况下要比AMVP模式更值得先试为什么某些纹理块直接用skip会损失不大这些问题的答案几十年来基本是靠工程师在大量视频样本上跑实验总结出来的有的还带着很强的“直觉”成分。传统编码发展到今天这种人工调参的红利已经吃得差不多了继续在搜索启发式上抠细节边际收益越来越小。神经编码出场本质是针对这个瓶颈的一次釜底抽薪。3. 神经编码的三次本质跃迁从模块替换到端到端学习3.1 自编码器结构编码器和解码器同时被学习神经编码的基石结构是自编码器。用在图像压缩上通常长这样输入图像x经过编码网络求出隐表示z再对z做量化得到z_hat再通过解码网络重建出x_hat。训练目标是让x_hat尽可能接近x、让z的熵尽可能小。就这么一个看似简单的结构已经和传统编码在世界观上完全不同了。传统编码里编码器和解码器是两套独立的、由人设计的规则体系一旦标准定了两边的行为就完全锁定。神经编码里编码器和解码器是同时训练出来的两个网络各自拥有几百万到几千万个参数配合一个联合损失函数在训练集上共同演化。编码器怎么把像素映射成隐表示解码器怎么从隐表示恢复像素不需要人规定“DCT系数应该怎么排”“运动向量应该怎么搜”这一切都由损失函数逼着网络自己学出来。这么说有点抽象我用一个生活化的类比传统编码像是一套精细的手工操作流程每一道工序都有老师傅设计的专用工具和操作手册工具之间能不能配合取决于接口精不精确神经编码则像是一个学徒直接学“整个烹饪流程”他不需要你告诉他盐应该放多少克、火开多大他通过反复试错和调整自己形成一套能把菜做好的手法——手法不一定符合任何既有规则但结果就是更好吃。当然这样说会让人误解为神经编码“没有任何规则”其实不对。网络结构的设计仍然有大量人工成分比如怎么引入超先验、怎么设计上下文模型、怎么把量化做成可导的这些都是架构层面的“规则”但底层压缩逻辑已经从“人写规则”变成了“数据驱动学规则”。3.2 可学习的先验与熵模型码率从哪来传统编码里码率是由量化后的变换系数经过CABAC上下文模型后产生的。这个上下文模型是人工设计的它假设系数之间存在某种统计相关性然后用状态机去跟踪和利用这种相关性。神经编码里也有熵编码但它对码率的估计方式完全不同——它用一个神经网络去预测隐表示z_hat的概率分布这个网络叫熵模型或者叫先验模型。“先验”这个说法听着玄乎其实核心就是解码端在拿到数据之前对隐表示z_hat的先验期望是什么。如果解码端能准确预测z_hat里每个元素的值分布熵编码就能以极低的码率把z_hat传过去如果预测得不准码率就会浪费。所以神经编码训练时除了让重建图像质量高还要让熵模型能精准预测隐表示的分布这本质上是在学数据的内在统计结构。更精细的做法是超先验也就是把编码器的旁路信息也编码进码流里用来帮助解码端更准确地预测主隐表示的分布。主路编码图像内容旁路编码“这个图的内容分布长什么样”解码端拿到旁路信息后就知道主路的统计特性熵编码就更高效。这套机制已经远远超出了传统编码“变换系数上下文模型”的框架因为它把“对信源统计特性的建模”本身变成了可学习的模块而不是靠人工设计一个通用的上下文状态机。3.3 率失真目标变成训练损失衡量标准前移神经编码最本质的一跃在这里率失真优化不再发生在编码过程的候选模式选择中而是直接嵌入神经网络训练的总损失函数里。训练损失通常写成这样L D(x, x_hat) λ × R(z_hat)其中D是重建失真R是估计码率λ是控制码率和失真相对于训练目标权重的系数。左边这一项逼着网络把图画准右边这一项逼着网络把码率降低二者在训练过程中相互对抗又相互妥协。最终训练出来的编码器和解码器本身就是在一个特定λ值下、在率失真最优的约束下得到的。这个迁移是革命性的。在传统编码里D和R的权衡发生在“给定一个压缩算法如何用参数找到最优点”在神经编码里D和R的权衡发生在“给定一个网络架构如何通过学习找到最优的压缩表示”。前者是搜索问题后者是学习问题。λ在这个意义上已经从“编码时的一个参数”变成了“训练时的一个权重”。同一个网络结构用不同的λ去训练得到的就是“偏向高质量”和“偏向低码率”两种不同性格的编码器它们之间不再可能通过简单调参互相转换。这里有个容易被忽略的工程含义λ不是调一个值就能通吃的。神经网络训练一次要跑很久如果你需要一个码率范围很大的编码系统就得训练多个不同λ的模型把它们做成多个“率失真操作点”。这跟传统编码器里在一条曲线上平滑移动CRF值完全不同。3.4 所有模块联动不再有“局部最优”的人工接口传统编码的模块优化是分而治之的变换和量化可以合起来优化运动估计可以单独优化熵编码上下文可以单独设计但它们之间的接口是固定的。固定接口的好处是模块可以分别演进坏处是全局最优被牺牲了。举例来说运动估计追求的是最小化残差能量但残差能量小了之后变换系数的分布未必更利于熵编码甚至可能导致码率反而变高。传统编码器之所以用“SSD码率加权”的组合代价函数就是试图在模块间做一个妥协。神经编码把所有模块焊死在了一个联合优化目标里。网络要同时学怎么生成残差、怎么转换到隐空间、怎么量化、怎么熵编码整个链路里的每一个权重都在同一个梯度的驱动下更新。运动补偿在里面也不再是“搜一个运动向量”这么简单而是变成一个可学习的运动表示用光流网络或者注意力机制从参考帧和历史帧里提取信息。这样做出来的结果在原理上更接近全局最优虽然代价是训练难度和推理复杂度都大幅上升。我见过一些对神经编码抱怀疑态度的人说“这不就是把一个黑盒网络放在编码里吗谈不上实质进步”。但如果你从“模块化人工规则”到“端到端联合优化”这个视角看它的本质变化确实已经发生压缩过程第一次做到了从输入像素到输出码流之间的全局可微而全局可微意味着压缩这个优化问题的解法从“搜索”变成了“梯度下降”。这一换接下来的玩法就完全不一样了。4. “调参数”和“训练参数”之间的九条街4.1 人调的是超参网络学的是权重写到这里我得把“AI调参数”这个误区再按在地上摩擦一遍因为它导致的误解不只是概念问题还会直接影响工程判断。在传统编码器里“调参”指的是人去选择CRF、去调整preset、去设定码率控制的目标码率、去开或关某些工具比如SAO、alf、tskip。这些参数每一个都对应编码器运行过程中的一个具体分支判断。你调了CRF编码器的量化步长就会变率失真优化里的λ就会变输出的码流就会按可预测的规律变。人完全可以解释“我为什么要这么调”。在神经编码器里训练过程确实也要设很多超参数网络结构、通道数、训练的λ、batch大小、学习率、量化模拟方式。但这些超参数的作用方式是极其间接的它们决定不了某个具体视频帧的编码行为。真正决定“这个编码器输出什么码流”的是模型里那几千万个权重那些权重是训练优化器根据损失函数的梯度一步一步更新出来的。训练一个神经编码器跟x265里敲一个--crf 20完全是两个世界的事情。4.2 优化目标完全不同局部规则 vs 全局率失真从优化的视角看这个区别更尖锐。传统编码器的率失真优化是在编码时对每个块、每个模式做局部的拉格朗日代价比较它是在一个已经固定好的算法框架内寻找“最优参数组合”。这种搜索是在“给定规则体系”下进行的规则体系本身是人工定的它把优化空间限制住了。不管你怎么搜运动模型还是平移假设变换还是那些固定的基函数量化还是均匀标量量化加deadzone。你只能在框架内调出最好的值框架本身的缺陷是调不掉的。神经编码的优化发生在训练阶段它对整个“压缩过程”求梯度。每一个网络权重都同时影响着预测、变换、量化模拟、码率估计、重建质量梯度会让它们协同演变。它不是在给定规则里找最优参数而是在给定架构和数据里找最优的压缩行为。规则体系从“人工设定”变成了“取自训练数据”。这个区别用一句话概括就是传统编码是在既定的数学公式里选最好的系数神经编码是让网络自己生长出一套数学公式。4.3 把神经编码当AI调参会带来哪些误判这个概念错位在实践中会制造至少四个具体误判我逐个说第一个误判过高估计神经编码对现有编码器的渐进改进。如果以为神经编码只是“AI调参数”会觉得它也就是在x265/VTM基础上提升几个百分点。实际上公开研究里成熟的神经视频编码器在低码率区间相比VTM可以达到两位数的码率节省但这种优势的来源不是“更好的参数”而是不同的压缩范式所以评估方式也必须重来。第二个误判低估重新训练的成本。如果按调参来理解会觉得神经编码部署很容易——模型给过来调几个参数就适配场景。实际上训练一个跨码率范围可用的神经编码器需要消耗大量GPU资源和海量数据不同码率点往往需要多个模型光这一点就决定了它和传统编码的生产运维逻辑完全不同。第三个误判对硬件要求的理解错位。传统编码器的编码端复杂度可以靠preset控制解码端在实时场景下可以用专用硬件解码。神经编码器推理是张量运算解码复杂度跟模型大小强相关一个几十毫秒推理的模型在某些场景下根本跑不满实时解码需求。这不仅仅是“性能调优”的问题得动硬件架构。第四个误判对“可控性”的预期错位。传统编码器你随时可以强制某个GOP结构、强制参考帧选择、强制I帧间隔。神经编码端到端训练完之后这些“规则”很难掰开去改它的一切行为都藏在网络权重里。如果你要做帧精准切点、要插入广告、要精确控制多个轨道间的同步很多传统编码器随手可调的东西神经编码器可能要重新训练甚至无从下手。这四个误判叠加起来会让团队对神经编码的投入产出比产生系统性的错误估计。与其说“AI调参数”是一个口碑问题不如说它是理解神经编码价值的最重要障碍。5. 神经编码真正落地时的几道坎5.1 复杂度账本码率省了算力贵了理论上的率失真优势是一回事工程上的复杂度账本是另一回事。我在实际接触转码服务的时候最直观的感受是神经编码把“编码复杂度”从CPU的指令级计算变成了GPU的张量计算。一个基于自编码器的神经图像编码器在分辨率不高的图上看不出太大的解码压力但一上视频流情况就完全不同了。视频编码不仅要对单帧做压缩还要处理帧间关系。神经视频编码器在前向编码时通常要连续处理参考帧、当前帧、运动信息整个时序上的依赖关系比单帧图像编码要复杂得多。公开对比数据里很多神经编码器在解码端动辄需要几十毫秒到几百毫秒每帧而同分辨率下硬解VVC的帧耗时可以低一个甚至两个数量级。如果你做的是点播场景编码端慢一点还能忍但解码端如果慢到影响播放首帧和拖动体验那就过不了产品关。这不是说神经编码永远会这么慢。模型蒸馏、通道剪枝、可变长推理这些手段已经在压缩模型的计算量专用推理芯片也在往这个方向走。但至少在今天“省码率”和“省算力”并不能画等号。决策时一定要分清自己是在买“压缩率”还是在买“总成本”。5.2 单模型码率适应能力有限λ只能“近似推广”传统编码器在整条率失真曲线上都可以连续工作你把CRF从14改到40编码器能立刻给出对应质量的输出。神经编码器的率失真行为是被训练时的λ“焊死”的一个模型通常只擅长一个比较窄的码率区间。你很难用一个训练在λ0.01上的模型去应付λ0.001时的高码率需求效果会明显变差。业界常用的办法是训练多个λ的操作点模型然后在推理阶段选择最接近的那个模型来跑。但这带来了三个问题模型存储变多、请求路由变复杂、不同操作点之间的画质波动可能不连贯。你从一个低码率模型切到高码率模型时同一帧的编码结果可能跳变明显这种体验跟CRF连续滑动的传统编码完全不是一个手感。如果产品对码率波动要求特别高比如自适应码率流里的多档位切换就必须投入额外精力来做模型调度和过渡平滑。这个成本常常在立项时被低估等真上线才发现“多模型管理”成了运维事故的高发区。5.3 主观质量与评价指标的老问题神经编码训练时常用的失真度量是MSE、MS-SSIM这类可导指标但观感质量和数值指标之间始终有差距。MSE对模糊的惩罚和对纹理细节的惩罚是均匀的人眼却对边缘、肤色、文字区域极其敏感。一个在PSNR上持平甚至略高的神经编码结果主观上可能不如传统编码器这在我的实际测试里经常遇到。现在研究界已经在往感知质量方向走比如用基于深度特征的距离LPIPS类或者GAN来做感知损失。但GAN的引入又是一把双刃剑它会让纹理看起来更自然但可能产生幻觉纹理在某些场景下甚至会画出不存在的细节。用在影视资料修复和游戏视频上问题不大用在监控、医疗、原始纪录这类对真实性要求极高的场景里就是事故。这里也顺带说一句评价神经编码器不能用“PSNR提升0.3dB”这种单一数字来决定优劣。必须结合主观对比测试、码率区间、内容类型偏好一起看。我做主观测试时习惯挑几类“刁钻内容”文字字幕、人脸特写、快速运动的体育画面、带细密纹理的自然场景。一个编码器在这四类上的表现比十个平均指标都更有说服力。5.4 延迟与实时性不是所有场景都能等最后还有一道工程坎是延迟。神经编码的整个推理过程是非线性的依赖上下文信息很难像传统编码那样逐块并行。直播、视频会议、云游戏的端到端延迟对每一帧的处理时间都极其敏感神经编码在这种场景下目前还很难打。我见过一个很有意思的折中方案在直播链路里沿用传统编码做低延迟传输但在录播、点播环节用神经编码做离线的码率压缩。这种混合架构在今天看是最常见的落地方式。它不是一个“终极答案”但非常务实——先让神经编码在它擅长的场景里证明价值再逐步往实时场景渗透。6. 如果你准备上手这几件事先想清楚6.1 什么场景值得上神经编码想清楚“值不值得上”比“怎么上”更重要。根据我看到的落地案例当前最成熟的三个场景是离线点播转码源视频只需要压一次不在乎编码慢在乎的是同码率下的画质。神经编码如果能把同样画质的码率降低20%CDN带宽和存储成本直接下降这个场景的ROI最好算。高质量归档档案库里的素材不追求实时但追求“尽可能无损地保存信息”神经编码可以在受限码率下保留更多高频细节归档场景对延迟完全不敏感。低码率窄带传输带宽极其有限的地方传统编码器已经压到极限了神经编码可以在极低码率下把画面“说得更清楚”。虽然主观质量依然有限但至少比马赛克强。这三个场景的共同特点是对编码端算力不敏感、对解码端延迟包容度高、对画质/码率的收益有直接定价。如果你的产品是直播推流、云游戏渲染这种实时链路我劝你先不要碰神经编码至少现在还不是时候。6.2 怎么正确看一个神经编码器的率失真曲线评估一个神经编码器最靠谱的方法就是把率失真曲线完整画出来而不是看单个点。两个编码器A在低码率点表现好B在高码率点表现好这很正常关键看你产品运行在哪个码率区间。要画的曲线至少有两条码率-PSNR或MS-SSIM曲线码率-主观评分曲线。前者反映客观压缩效率后者反映真实观感。画曲线时注意几个细节固定源序列最好用标准测试集加你自己的业务样本、固定分辨率、按平均码率而不是峰值码率来做对比、跑足够的帧数避免单帧波动。如果手头没有主观测试条件至少要做一个盲测小样本让几个人看同一段编码后的视频选择更舒服的那个不要看指标。另外还要看曲线在“连续码率变化”时的表现把一个λ模型的输出从低码率往高码率方向强行拉失真会不会突然恶化这样的测试能暴露模型的鲁棒性问题比只看“率失真曲线上三个点”有用得多。6.3 在工程里可以先行试水的台阶如果你现在就想在工程里试水我建议不要在核心链路上一步到位而是先找一个小切口先试基于神经网络的图像压缩比如做封面缩略图、广告素材、静态场景的首帧压缩这类场景风险低、比较容易拿结果。再往前一步在离线转码流水线里对特定内容类型比如动画片、慢速演讲启用神经编码看看相对传统编码的收益是否达到预期。最后才考虑做全链路的神经视频编码这时候要配套好模型管理、码率路由、质量监控体系别裸着上。每一步都要预留回滚路径。神经编码和传统编码不是非此即彼的关系同一个产品里完全可以“传统编码打底、神经编码在某些档位做增强”。我自己在尝试神经编码项目时最大的体会是一定要把“理解率失真优化”放在“学习网络结构”之前。这个任务里损失函数的设计、λ的选择、失真度量的权衡直接决定了模型能力的上限网络结构反而是在这个目标框架下的一层“实现细节”。你带着传统编码的率失真思维去看神经编码很多东西一点就透你只盯着网络结构和调参技巧很容易在关键问题上走偏。如果这篇文章能让你记住一件事那就是神经编码改变的从来不是“参数”,而是“压缩规则从哪来”。规则从人写的变成数据学的这才是真正的代际变化。后续你再看那些宣称“AI编码提升XX%”的评测先用这个问题掂量一下它到底属于AI外围增强还是属于真正的神经编码再决定这个数字有没有意义。
返回列表