ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一次微调提升可信吗:多种子与配对结果报告——32 条训练样本、96 条开发样本

一次微调提升可信吗:多种子与配对结果报告——32 条训练样本、96 条开发样本 一次微调提升可信吗多种子与配对结果报告——32 条训练样本、96 条开发样本系列从最小复现到可检验的科研问题日期2026-10-06读者研究生、科研新人和工程型研究者范围真实小模型、五次微调、开发集探索不是完整基准或最终确认实验。复现价值与论文位置随机种子是伪随机数发生器的起点它本身不是实验变量的完整定义。初始化、数据顺序、dropout和采样解码都可能受随机性影响但冻结预训练权重、关闭dropout、固定顺序并用贪心解码时种子可能没有机会起作用。PyTorch的复现文档也区分随机数控制与其他非确定性并不保证不同平台和版本位级一致。[3]**论文报告**Reimers与Gurevych在2017年的序列标注研究中指出单次分数不足以代表随机训练方法主张报告多次运行的分布。[1] 本文借用这个研究问题不移植其LSTM实验数字也不把三次小模型运行当成对原论文的大规模复现。Dror等人在2018年讨论统计检验与任务、指标、实验设计的匹配关系。[2] 这里选择简单可审计的配对差值刻意不追逐显著性标签。与092相比新增问题是“训练顺序改变后收益和损失是否同时重现”改变变量是顺序及配对冻结模型、数据、提示、监督量和评分器。新增产物是种子—样本结果矩阵、训练轨迹、权重哈希和两种不同统计摘要。核心思想两个不确定性不能混成一根误差线令基线在样本上的二值结果为b i b_ibi​第s ss次训练的结果为a s i a_{si}asi​则d s i a s i − b i , Δ s 1 n ∑ i 1 n d s i . d_{si}a_{si}-b_i,\qquad \Delta_s\frac{1}{n}\sum_{i1}^{n}d_{si}.dsi​asi​−bi​,Δs​n1​i1∑n​dsi​.这里i ii是同一条评测样本s ss是一个已训练检查点d dd只能为负一、零或一本次SST结果矩阵形状为[ 3 , 64 ] [3,64][3,64]三个重排运行共享同一个基线。配对要求比较同一行而非把两份总准确率各自重采样后相减。一个直观例子是模型甲和乙都答对五十八条不能由此推断它们答对的是同一批题。如果甲多救回一个例子、又多失去另一个例子总分完全看不出来。逐行结果同时保存提示哈希、标签、停止原因和生成标记才能区分真实行为变化、输入错配与评分器变化。比较时先确认这些身份一致再计算差值能够避免把换题误当提升。第一层固定这64行报告三个Δ s \Delta_sΔs​的均值、范围及样本标准差Δ ˉ 1 S ∑ s Δ s , S D ∑ s ( Δ s − Δ ˉ ) 2 S − 1 . \bar\Delta\frac1S\sum_s\Delta_s,\qquad SD\sqrt{\frac{\sum_s(\Delta_s-\bar\Delta)^2}{S-1}}.ΔˉS1​s∑​Δs​,SDS−1∑s​(Δs​−Δˉ)2​​.S 3 S3S3分母为二这个标准差描述本次训练顺序波动不是总体均值的置信区间更不能包含尚未试过的模型初始化或数据抽样因素。两个固定顺序控制不混入这三个运行。第二层固定一个训练后检查点和基线从同一行索引有放回抽样计算每次配对均值再取百分位区间。这种bootstrap即重采样本次做一万次。它只展示固定模型对当前样本构成的敏感程度不代表重新训练的不确定性。不能把三次预测摊成192条独立测试例新闻任务保持四类平衡按标签类内抽样。图中Seed Spread仅汇总三个重排运行Sample Bootstrap针对单个固定模型对。共享评测样本只进入结果计算不回流到检查点选择。最小实验与冻结协议使用已完成指令训练的SmolLM2-135M-Instruct约1.345亿参数。模型与tokenizer固定到12fd25f77366fa6b3b4b768ec3050bf629380bac不是从随机权重训练。SST-2固定revision为8d51e7e4887a4caaa95b3fbebbf53c0490b58bbbAG News为eb185aade064a813bc0b7f42de02595523103ca4。二十个文件的实际SHA-256及下载地址随源码保存。[4–6]沿用32条情感训练、64条情感开发和32条新闻开发。训练行仍按既定哈希规则选取未重新挑选容易学习的例子。128条情感确认和64条新闻确认始终没有推理新闻来自官方test的部分已在091用于开发选择不能重新称为未见测试集。规范化精确重复检查通过但没有证明不同影评来自独立电影也没有做预训练污染排查。五组都从相同原权重开始全参数SGD学习率0.001、梯度裁剪1、批量2、64步。每行JSON答案连真实终止符共8个监督token每组1024个监督token、10556个输入token四轮中每行出现四次。提示和填充位置不计损失真实终止符保留。CPU四线程、单精度、eager注意力保留梯度但不启用dropout贪心生成最多32个新token。固定组93与94保持原有负正交替顺序只改框架种子。重排组93、94、95每轮分别打乱两类各16行再逐对组合确保每个批次一正一负。因此改变了顺序与批内配对没有改变类别比例和暴露量。填充位置分别为11252、11298、11338控制组为11344相同输入量仍不等于相同计算量。协议在推理前登记不选择最好的种子也不补跑到结果满意为止。五组小试跑共10步、48次生成耗时18.31秒峰值内存2.62GB按预定保守倍数估算439.32秒低于1200秒预算后才正式执行。官方代码阅读路线先读固定版本apply_chat_template确认用户输入和assistant回答的边界再看本地build与collate检查真实EOS和填充虽共用编号2却由长度区分。随后沿LlamaForCausalLM找到ForCausalLMLoss输入为[ B , L ] [B,L][B,L]输出logits为[ B , L , 49152 ] [B,L,49152][B,L,49152]其中最后一维是词表标签需要与前一位置预测对齐。[7]本次每一步都将官方损失与手工移位交叉熵核对最大误差约1.19 × 10 − 7 1.19\times10^{-7}1.19×10−7。最后读官方SGD的更新再回到独立教学调度器确认种子实际进入了Python的顺序发生器。五个官方源文件已与安装版本逐字节比对永久文件、函数行号、提交和许可证集中在源码地图不用浮动main定位。统计代码另外阅读先看da-b是否按相同样本对齐再看重采样矩阵是否同时作用于两个模型最后检查标准差的分母。推理正确与统计解释正确是两个检查不能互相替代。本次实际验证与配对结果正式实验共320步更新、960次生成全部成功耗时267.90秒进程峰值RSS为2961309696字节。该时间从第三方导入后计包含核验、加载、训练、保存、推理及统计GPU内存未测。没有隐去训练失败也没有使用确认集调参。状态单词输出联合正确/64JSON格式成功/64JSON内容及联合正确/64新闻联合正确/32原检查点570内容50、联合08固定933364588固定943364588重排933364588重排943364578重排953364588格式成功指满足严格输出约定内容正确只是输出中唯一显式标签与数据标签匹配的代理不是人工语义金标。联合正确要求两者同时满足。三个重排JSON联合准确率均值90.10%样本标准差0.90个百分点这个醒目的提升主要包含从零到全部合格的格式变化不能直接说情感理解提升了九十个百分点。单看内容重排93相对基线为12胜、48平、4负净增12.5个百分点条件配对区间为[0,25]个百分点重排94为11胜、49平、4负区间[0,21.875]。两者只有编号481的输出不同前者答positive后者答negative数据标签为positive。保留这个索引足以定位差异无须在公开包重印许可未知的影评。相反所有训练后的单词约定均为5胜、30平、29负净降37.5个百分点条件区间为[-53.125,-21.875]。JSON变好与单词回答变差同时重现。新闻前后每行联合对错均不变区间为[0,0]它只说明本批差值全零原有8/32地板表现不足以支撑“保住了新闻理解能力”。失败排查与证据边界先查“假多种子”固定组的64步损失、梯度与091逐项相同两个数值权重哈希一致三个重排权重则互异。保存文件名会改变PyTorch容器哈希所以另对张量名、形状和数值字节计算身份避免把序列化差别当模型变化。此外重排没有重新抽取训练样本因而没有测量训练集选择的波动。三个种子也没有形成三份新的基线原模型只推理一次后续比较共享它的逐行结果。这种共享关系必须保留在表格和统计脚本中。若未来增加数据集抽样应单独登记新的随机因素和独立单位不能沿用当前标准差解释。再查“区间证明提升”64条开发样本已反复用于选择与解释重采样不能把它们变回未见数据。区间端点碰到零也不能简化为“完全无效”这里的设计只支持有范围的描述。跨样本相关性、训练种子数少、单一小模型都限制外推。最后查“可以公开重算多少”全部960条原始输出已本地独立解析公开证据删节11条可能复述新闻的长回答保留原文哈希、长度及派生分数其余949条可完整重解析。删节行不是凭空丢失原始审计与分发说明可追踪读者自行运行可获得自己的完整结果。未捏造人工评分。可检验的研究问题与总结**作者推断**当前现象更像对输出约定的强适配并伴随另一约定下的标签偏移本实验没有隔离出具体内部机制。后续可冻结这套配置在保留确认集一次性检验相同方向也可另开开发实验对比保持类别平衡的重排与普通随机批次检验稳定性是否依赖配对方式。两者都要先登记规则不能看过确认结果再换假设。本篇不推荐挑58分的种子发布。值得交付的是真实变化的随机源、所有运行、同一行上的胜负以及没有被误差线掩盖的能力代价。第二单元至此得到一套可审计微调资产下一篇将检查官方评测任务配置本身怎样定义分数。源码与复现入口本地源码与归档已通过真实解压运行验收。公开发布目前受阻Safari与匿名Git均无法建立到GitHub的安全连接尚无本篇公开提交。目标为既有科研源码仓库这只是仓库入口不是已发布的本篇源码。网络恢复后须补齐固定提交目录、README与SOURCE_MAP整篇暂不验收通过。准备依赖并下载固定资源后最小命令为HF_HUB_OFFLINE1TOKENIZERS_PARALLELISMfalse python run.py--cache./cache--outsmoke-new--privateprivate-new--smoke它实际训练五组并保存逐步损失、逐样本输出、预算、配对统计和权重身份正式运行去掉--smoke。本次已完成完整五组及原始审计归档在临时目录解压后的五组试跑也通过逐步训练记录与生成结果除耗时外一致。源码自带全部自写模块复用已核验缓存不要求读者打开作者本地路径。参考资料检索日期2026-10-06。以下论文支持方法动机或数据来源本文数字均来自随附日志。Nils Reimers、Iryna Gurevych2017EMNLPReporting Score Distributions Makes a Difference: Performance Study of LSTM-networks for Sequence Tagging。Rotem Dror、Gili Baumer、Segev Shlomov、Roi Reichart2018ACLThe Hitchhiker’s Guide to Testing Statistical Significance in Natural Language Processing。PyTorch 2.6Reproducibility。HuggingFaceTB固定SmolLM2-135M-Instruct模型卡。Richard Socher等2013EMNLPRecursive Deep Models for Semantic Compositionality Over a Sentiment Treebank。固定数据文件及哈希见源码资源锁。Xiang Zhang、Junbo Zhao、Yann LeCun2015NIPS页面为v3修订Character-level Convolutional Networks for Text Classification本次固定AG News数据卡。Hugging Face Transformers 4.49.0固定因果语言模型损失实现。其余官方函数与许可见SOURCE_MAP。
返回列表