
这篇论文提出了TabICL一种用于大规模表格数据分类的表格基础模型核心目标是解决现有表格上下文学习ICL模型尤其是 TabPFNv2在大数据集上计算成本过高、难以扩展的问题。以下是对其主要研究内容的全面总结。一、研究背景与问题表格数据广泛存在于医疗、金融等领域长期由梯度提升决策树GBDT如 CatBoost、XGBoost主导。近年来表格基础模型如 TabPFN、TabPFNv2通过上下文学习ICL在中小规模表格上取得突破将训练数据作为上下文测试数据在单次前向传播中预测无需参数更新。核心瓶颈TabPFNv2 使用交替的列注意力和行注意力计算复杂度为在样本数 n 较大时计算和内存开销急剧上升难以处理工业级大规模表格如数十万样本。研究问题ICL 能否有效扩展并在大规模表格上仍具竞争力二、TabICL 的核心方法TabICL 采用两阶段架构将表格嵌入与上下文学习分离显著降低计算复杂度。1. 整体结构先嵌入后 ICL第一阶段表格嵌入模块将每一行不含标签编码为固定维度的稠密向量捕获整表信息并压缩列维度为后续 ICL 降低复杂度。第二阶段ICL 模块将行嵌入与标签结合通过 Transformer 在单次前向传播中预测整个测试集。2. 分布感知的列嵌入将每一列视为一个集合输入问题使用Set TransformerISAB为每个单元格生成分布感知的权重和偏置。所有列共享同一个嵌入网络实现跨表格可迁移性。通过诱导自注意力ISAB将复杂度降至 O(n)并防止数据泄漏仅训练样本作为键值。可视化表明学习到的列嵌入能编码偏度、峰度等统计特性起到“特征标识符”的作用。3. 上下文感知的行交互使用 3 层 TransformerTFrow对每行特征进行交互建模并用 4 个可学习的[CLS] 令牌聚合为单个行向量。表示崩溃问题当多个特征分布相似时行嵌入会趋于相同。TabICL 引入旋转位置嵌入RoPE打破对称性有效缓解崩溃。为近似恢复列排列不变性在多个列置换上集成预测。4. 数据集级上下文学习将行嵌入与独热编码标签相加形成训练嵌入。使用 12 层 TransformerTFic进行 ICL训练嵌入可相互关注测试嵌入只能关注训练嵌入。最终通过两层 MLP 输出类别概率。5. 计算复杂度优势由于列维度被压缩TabICL 在大样本场景下显著更高效。三、预训练与推理优化1. 改进的合成数据预训练基于结构因果模型SCM生成合成数据。新增基于树的 SCM使用 XGBoost 生成引入树模型的归纳偏置。丰富激活函数增加 15 种非线性函数包括高斯过程随机函数提升数据多样性。2. 课程学习三阶段逐步扩大预训练样本规模1K → 40K → 60K。阶段 3 仅训练 ICL 模块冻结其他组件。预训练共约8200 万个合成数据集使用 3 块 A100 GPU 训练 20 天。3. 层次类别扩展对超过 10 类的分类问题构建层次分类树每个节点最多 10 类。所有子任务共享行嵌入和 ICL 模块高效支持大量类别。4. 内存高效推理利用 FlashAttention 和多项式回归动态调整批次大小。支持中间激活卸载到 CPU/磁盘。100K 样本 500 特征仅需 5GB GPU 内存500K 样本 500 特征约需 14GB GPU 内存。四、实验结果1. 基准与设置在TALENT 基准上评估包含 200 个分类数据集排除 15 个 TabPFNv2 开发集后为 171 个 ≤10 类数据集。与 30 多种基线方法比较包括 CatBoost、XGBoost、RealMLP、ModernNCA、TabPFNv2 等。2. 主要结果准确率TabICL 在所有数据集上取得最佳中位相对准确率与 TabPFNv2 统计上无显著差异但显著优于其他方法。速度TabICL 比 TabPFNv2 快1.5×小数据到 3–10×大数据每 1K 样本训练推理仅 1.1 秒而 CatBoost 调优约 3 分钟。大规模数据在 53 个超过 10K 样本的数据集上TabICL 超越 TabPFNv2 和 CatBoost。概率质量在对数损失上TabICL 与 TabPFNv2 显著优于准确率调优的竞争者。多类别通过层次分类TabICL 在 10 类数据集上仍取得第二好成绩。3. 消融研究基于树的 SCM提升预训练效果。课程学习将 TabICL 平均排名从第 9 提升至第 1。RoPE有效缓解表示崩溃。随机森林扩展可进一步提升 TabICL 和 TabPFNv2 在大数据集上的性能。五、主要贡献提出 TabICL一种可扩展的表格基础模型支持任意样本数、特征数和类别数最高可处理500K 样本、500 特征。分布感知特征嵌入统一处理不同分布特征实现跨表格迁移。高效 ICL单次前向传播无需超参数调优比传统方法快数个数量级比 TabPFNv2 快最高 10 倍。大规模验证在 TALENT 基准上证明 ICL 在大数据上仍具竞争力超越 GBDT 和 TabPFNv2。六、局限性与展望推理速度仍较慢但可通过缓存缓解。RoPE 破坏列排列不变性需通过集成近似恢复。当前仅支持分类回归可沿用类似方法。评估依赖 TALENT 基准存在其固有局限如缺失值处理、类别信息提供等。展望预训练诱导的隐式先验使 ICL 即使在大数据下仍具优势未来可进一步探索回归、缓存加速和更高效的集成策略。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要梯度提升决策树在表格数据上的长期主导地位目前正受到使用上下文学习ICL的表格基础模型的挑战将训练数据设为测试数据的上下文并在单次前向传播中预测无需参数更新。尽管 TabPFNv2 基础模型在多达 10K 样本的表格上表现出色但其交替的列注意力和行注意力机制使得处理大型训练集在计算上不可行。那么ICL 能否有效扩展并为更大的表格带来收益我们提出了 TabICL一种用于分类的表格基础模型在多达 60K 样本的合成数据集上预训练并能在可负担的资源下处理 500K 样本。这得益于一种新颖的两阶段架构先列后行的注意力机制构建行的固定维度嵌入然后使用 Transformer 进行高效的 ICL。在 TALENT 基准的 200 个分类数据集上TabICL 与 TabPFNv2 性能相当同时系统性地更快最高达 10 倍并显著优于所有其他方法。在 53 个超过 10K 样本的数据集上TabICL 超越了 TabPFNv2 和 CatBoost展示了 ICL 在大数据上的潜力。1. 引言表格数据以行和列的形式结构化广泛应用于医疗Cartella 等2021和金融Johnson 等2016等行业其中表格分类问题支撑着众多现实世界应用。在其他数据模态中基础模型——特别是大型语言模型LLMZhou 等2024——显著提升了处理新任务和少样本学习的能力。这在很大程度上归功于它们卓越的上下文学习ICL能力Brown 等2020使其能够在无需参数更新的情况下捕捉提示中的模式。这一成功加上表格的普遍性激发了人们对表格基础模型的兴趣van Breugel van der Schaar2024。虽然 LLM 主要设计用于建模自然语言但将其微调用于表格数据的尝试已经出现Hegselmann 等2023Fang 等2024 及其中的参考文献。这些努力依赖于表格序列化即将表格行转换为可标记化的文本或句子的过程。Gardner 等2024在序列化表格语料库上微调了 Llama 3-8B并证明了该方法在少样本设置下相比树基模型的有效性。然而此类基于语言模型的方法受限于其上下文窗口的大小难以容纳大型序列化表格例如 Gardner 等 2024 中最多 32 或 64 个样本。此外LLM 能否有效处理数值仍不明确Thawani 等2021。最后有证据表明 LLM 在许多流行数据集上进行了预训练Bordt 等2024因此在表格预测任务上的评估也应谨慎进行。Hollmann 等2022采取了一种截然不同的方法引入了 TabPFN一种基于 Transformer 的表格基础模型仅在不含真实数据的合成表格数据集上预训练用于分类任务。TabPFN 的一个关键特性是使用表格进行 ICL这消除了标记化的需要并能高效处理多达 1K 样本和 100 个特征的小型表格。同一作者随后引入了 TabPFNv2Hollmann 等2025这是一个改进版本在多达 10K 样本和 500 个特征的中小型数据集上显著优于树基模型和神经网络竞争者。表格 ICL 的巨大前景催生了一条新的研究方向见第 2.3 节但自注意力的二次成本威胁着所有这些方法的可扩展性。TabPFNv2 使用在列注意力和行注意力之间交替的双向注意力机制这限制了其在大数据集上的可扩展性。在现实场景中工业数据集可能包含数百万个样本Rubachev 等2024TabPFNv2 的高计算和内存需求阻碍了其实际应用。在本文中我们介绍了 TabICL一种基于 PFNMüller 等2024的可扩展且高效的表格基础模型专为分类任务设计。TabICL 在多达 60K 样本的合成数据集上预训练能够有效处理多达 500K 样本和 500 个特征的数据集显著扩展了表格 ICL 的可扩展性。为了适应任意大小的表格TabICL 将单个单元格视为基本单元每一列被视为一组捕获特征特定分布和语义的单元格值而每一行包含相互依赖的特征值。TabICL 采用两阶段架构来实现表格数据的高效 ICL。首先它将行不包括目标标签编码为稠密向量嵌入。每个嵌入旨在捕获整个表格信息。这一阶段有效地压缩了列维度从而大幅降低了后续 ICL 的计算复杂度和内存占用。其次它将这些紧凑但信息丰富的嵌入与相应的标签结合然后执行 ICL。因此TabICL 的核心在于其第一阶段的嵌入策略该策略旨在将行转换为语义丰富的嵌入。在自然语言中单词通常具有明确的语义因此自然地与信息丰富的嵌入相关联Mikolov 等2013。然而表格数据缺乏这种固有的结构如果没有列名或数据类型等元数据单元格值可能是模糊的。为了应对这一挑战TabICL 采用了一种约束良好的嵌入策略结合了1分布感知的列嵌入以捕获每列内的统计规律以及2基于注意力的行交互以建模跨列的依赖关系从而为表格数据构建语义有据的表示。特征嵌入涉及将标量单元格值映射到每个特征的高维向量是模型性能的关键因素Gorishniy 等2022。由于特征通常表现出截然不同的分布先前的方法通常使用特征特定的嵌入模块而不共享参数然而这限制了跨表格的可迁移性。在这项工作中我们将特征嵌入重新表述为一个集合输入问题其中排列不变的单元格值集合作为输入输出包含对应的一对一嵌入。为实现这一目标我们利用了 Set TransformerLee 等2019这是一个专门设计用于通过高效诱导自注意力处理集合的模型。它擅长识别极值和计数唯一元素等任务能够发现每列内与分布相关的元数据并增强区分不同数据类型特征的能力。特征嵌入随后由另一个 Transformer 逐行处理并使用可学习的 [CLS] 令牌聚合为单个向量。这有效地捕获了复杂的特征交互并适应可变数量的特征。总体而言这种基于先列后行注意力的嵌入通过利用表格数据固有的列/行结构作为强归纳偏置实现了所有单元格上的高效稀疏注意力。最后得到的行嵌入由最终的 Transformer 处理以进行 ICL。除上述创新外我们还引入了进一步的改进1我们通过添加新的基于树的数据生成模型来改进 TabPFN 的预训练合成数据集以纳入树基模型的归纳偏置Grinsztajn 等2022den Breijen 等2024Grinsztajn20242我们采用课程学习将预训练数据集大小从 1K 扩展到 60K3为解决超过 10 个类别预训练限制的分类问题我们使用层次分类Silla Freitas2011将其分解为类别数 ≤ 10 的子问题的层次结构。任务数量的增加在很大程度上被 TabICL 的快速预测所抵消。总结我们的贡献1我们提出了 TabICL一种新颖的可扩展表格基础模型用于分类任务可适应任意数量的样本、特征和类别。在实践中TabICL 使用约 20GB GPU 内存处理多达 500K 样本和 500 个特征2我们引入了一种分布感知的特征嵌入方法以统一的方式处理具有不同属性的特征为跨表格可迁移性开辟了新的可能性3TabICL 在单次前向传播中执行任务比需要超参数调优的表格方法快几个数量级同时在大多数情况下仍提供更好的性能。TabICL 也始终比 TabPFNv2 更快最高达 10 倍且效率增益随数据集大小增长而增加4我们在 TALENT 基准Ye 等2025上评估了 TabICL该基准包含 200 个跨不同领域和大小多达 150K 样本的分类数据集。TabICL 在中等规模数据集上与 TabPFNv2 性能相当并显著优于所有其他方法。在 53 个超过 10K 样本的大型数据集上TabICL 超越了 TabPFNv2 和 CatBoostDorogush 等2018。这些结果展示了 ICL 在大数据上的潜力。2. 相关工作2.1. 基础模型与上下文学习近年来深度学习因基础模型的出现而发生了变革这些模型在海量、多样化的数据集上预训练并作为下游任务的通用骨干。这些基于 Transformer 的模型支持上下文学习ICL通过分析包含输入-输出对的提示来执行任务无需显式训练或参数更新。ICL 作为一种即时推理形式运作。ICL 背后的机制仍然难以捉摸主流解释将其框架为隐式贝叶斯推断Xie 等2022Müller 等2024、梯度下降优化von Oswald 等2023和算法学习Garg 等2023。2.2. 表格深度学习模型梯度提升决策树GBDT如 CatBoost 和 XGBoostChen Guestrin2016长期主导表格领域。然而越来越多的努力集中在开发用于表格数据的深度学习模型。近期研究表明GBDT 与表格深度学习模型之间的性能差距正在缩小Ye 等2024Gorishnii 等2024。随着表格深度学习的进步跨表格可迁移性成为一个重要课题。这一方向的显著努力包括 XTabZhu 等2023和 CARTEKim 等2024它们结合了可迁移组件通常是可共享的骨干网络和需要针对每个新任务微调的数据集特定组件。表格基础模型的出现可以为跨表格学习带来新的可能性为跨表格的大规模预训练和迁移学习铺平道路。2.3. 表格基础模型TabPFN全称表格先验数据拟合网络Tabular Prior-Data Fitted Network是一种表格基础模型。它是一个在大量合成数据集上预训练的 Transformer通过 ICL 执行表格分类任务。TabPFN 从贝叶斯角度将 ICL 解释为合成数据集上的近似后验预测分布。一些变体旨在增强其可扩展性包括通过提示调优将训练数据蒸馏为紧凑的学习上下文Ma 等2024bFeuer 等2024、为每个测试样本选择最相关的训练数据子集Xu 等2024Thomas 等2024Koshil 等2024、用线性注意力替代二次注意力Zeng 等2024以及通过基于 ICL 的超网络生成小型任务特定神经网络Müller 等2023。然而大多数变体并未在结构上改进 TabPFN而是作为提示工程来减少上下文样本。一些 TabPFN 变体尝试提高预训练数据的质量例如 TabForestPFNden Breejen 等2024纳入基于树的合成数据集以及 TabDPTMa 等2024a使用真实世界数据集。TabPFNv2 在预测性能和可扩展性方面大幅改进了 TabPFN。我们的新模型 TabICL 实现了与 TabPFNv2 相当的性能同时更快。3. TabICL 架构3.1. 高层结构先嵌入后 ICLTabICL 包含两个关键模块一个表格嵌入模块后接一个 ICL 模块标签仅在 ICL 模块中使用。表格嵌入模块将表格行编码为稠密向量表示同时考虑固有的列-行结构。该模块由两部分组成分布感知的列嵌入捕获单个列的统计特征上下文感知的行交互建模特征之间的依赖关系。ICL 模块随后通过 Transformer 处理训练和测试嵌入使得能够通过 ICL 在单次前向传播中预测整个测试集。整体架构如图 1 所示。3.2. 分布感知的列嵌入3.3. 上下文感知的行交互图 2. TabICL 中的分布感知列嵌入块。整体结构右依赖于诱导自注意力块中该块采用两个多头注意力块左来处理传入嵌入。图 3. 学习到的列嵌入编码了特征分布的统计特性。这些嵌入在合成数据集 40,000 个特征上的前两个主成分投影可视化。图 4. 平衡秤数据集上无 RoPE 的学习崩溃示例。上直方图显示四个特征遵循相同的离散分布。下输入特征和学习到的行嵌入 H 在有无 RoPE 情况下的 t-SNE 可视化表明RoPE 能有效缓解表示崩溃。颜色代表 3 个类别。虽然使用 RoPE 打破了关于列顺序的排列不变性但它能有效缓解表示崩溃。例如在平衡秤数据集上RoPE 保持了不同样本之间的不同表示图 4 中。遵循 Xiong 等2023我们使用 100,000 的大缩放因子进行 RoPE以增强对训练期间未见过的更多特征最多 100 个的泛化能力。为了近似恢复排列不变性TabICL 采用与其他 TabPFN 类模型相同的策略即在多个列置换上集成预测。3.4. 数据集级上下文学习3.5. 计算复杂度分析4. 预训练与推理4.1. 改进的预训练合成数据集4.2. 大规模预训练的课程学习4.3. 层次类别扩展策略4.4. 内存高效推理5. 实验5.1. 基准我们在 Ye 等2025引入的 TALENT 基准上评估 TabICL。它包含 200 个分类数据集120 个二分类和 80 个多分类数据集并附有 30 多个基线方法的结果。为确保公平比较我们排除了 TabPFNv2 用于超参数调优和模型选择的 15 个数据集更多细节见附录 F。在下文中我们主要关注最多 10 个类别的 171 个数据集因为这些可以由 TabICL 和 TabPFNv2 原生处理。数据集分为 64% 训练、16% 验证和 20% 测试数据。虽然大多数模型依赖验证集进行早期停止和超参数调优但 TabICL 和 TabPFNv2 不这样做。尽管如此我们选择仅使用训练数据训练 TabICL 和 TabPFNv2这使它们处于劣势。另一方面TabICL 和 TabPFNv2 都利用集成而其他深度学习模型则不然。在附录 H 中我们表明增加集成大小可提高 TabPFNv2 和 TabICL 的性能其中 TabPFNv2 从集成中获益更多。公平比较需要将其他模型也作为集成进行训练。然而这在计算上昂贵不是原始基准的一部分并且在这些实验中未实现。TabICL 和 TabPFNv2 都对通过随机打乱列和类别并使用不同预处理器获得的 32 个预测进行平均。TabICL 对所有输入特征应用带或不带幂变换的 z-归一化。TabPFNv2 的细节见 Hollmann 等2025。为避免内存不足问题我们将 TabPFNv2 的训练集子采样至 30K 样本而 TabICL 可以在所有数据集上预测而无需子采样。此外我们在推理期间对所有方法禁用自动混合精度以确保可重复性和一致的时间测量。5.2. 结果TabICL 获得最先进的准确率。图 5 显示了所有模型相对于调优 MLP 的准确率。TabICL 在所有数据集上获得最佳中位相对准确率同时比传统最先进模型快得多TabICL 每 1K 样本的几何平均训练推理时间为 1.1 秒而在 CPU 上调优 CatBoost 约需 3 分钟在 GPU 上 RealMLP 和 ModernNCA 约需 7 分钟。根据获得的准确率查看每种方法的排名图 I.1 中的临界差异图显示 TabICL 和 TabPFNv2 以较大优势优于竞争者而两者之间的差异在统计上不显著。相对于 TabPFNv2 的加速。图 6 显示 TabICL 在小数据集上比 TabPFNv2 快 1.5×在大数据集上快 3−10×。这得益于 TabICL 的混合架构在 ICL 对标记行进行操作之前使用更少的昂贵行注意力和列注意力层以及更小的嵌入维度。在具有 10,000 个样本和 100 个特征的数据集上TabICL 大约需要 20 秒而 TabPFNv2 需要 1 分 40 秒对于 1000 个样本和 10 个特征的数据集TabICL 需要 1 秒而 TabPFNv2 需要 2 秒。TabICL 相对于 TabPFNv2 的经验加速也证实了第 3.5 节中的复杂度分析。在图 B.1 中我们拟合了简单的缩放律根据样本数量和特征数量预测 TabICL 和 TabPFNv2 的运行时间。这些缩放律表明对于大型数据集TabICL 的平均加速保持在约五倍。TabICL 使 ICL 适用于大型数据集。虽然 TabPFNv2 在多达 10K 样本的数据集上取得了优异性能但它仅在多达 2048 个训练样本上预训练并且由于内存使用在超过 30K 样本的数据集上可能失败。图 7 显示与 TabPFNv2 不同TabICL 的性能在较大数据集上保持强劲。虽然 ICL 常用于少样本设置但这表明基础模型即使在后者最具潜力的大样本场景中也能与最佳深度学习或树基模型竞争。附录 B 中的额外结果表明TabICL 在许多类别、特征和高比例分类特征的情况下也表现良好。为了增强 TabPFNv2 在大型数据集上的性能Hollmann 等2025提出了随机森林扩展在训练期间使用决策树划分数据并在每个叶节点拟合 TabPFNv2以在推理时实现局部预测。我们发现此扩展可以显著提高 TabPFNv2 和 TabICL 在大型数据集上的性能更多细节见附录 G。图 5. TALENT 基准上最多 10 个类别的准确率和训练/推理时间。红色条表示每种方法在所有数据集上相对于 MLP 的中位相对准确率改进。对于 TabICL 和 TabPFNv2报告的时间对应于在 A100 GPU 上的训练推理。对于其他模型包括训练和超参数调优。由于 Ye 等2025仅跟踪使用 100 次调优步骤后找到的最佳超参数的训练时间我们通过将该值乘以 100 来近似总训练时间。对于 TabPFNv1、LoCalPFN 和 TuneTables我们不报告时间因为原始时间测量不包括推理时间。图 6. TabICL 与 TabPFNv2 在少于 30K 样本且最多 10 个类别的数据集上的加速比。图 7. 模型排名作为样本大小的函数。每个点是一种方法在一个数据集上的排名。排名越低越好。线条显示 bootstrap 中位数和分段线性拟合的 10%/90% bootstrap 置信区间。TabICL 产生可靠的预测概率。在许多实际情况下估计概率的质量对决策至关重要。因此我们还报告了对数损失又称交叉熵损失这是一种适当的评分规则因此奖励准确的概率预测Gneiting Raftery2007。由于 TabICL 不利用超参数调优其预测并非专门针对准确率优化。附录 I 中的临界差异图显示TabICL 和 TabPFNv2 在对数损失上显著优于准确率调优的竞争者尽管两者之间的差异不显著表明两者都产生比其他模型更可靠的预测概率估计。TabICL 在超过 10 个类别时仍然有效。在超过 10 个类别的数据集上我们对 TabICL 应用第 4.3 节的层次分类策略。得益于其使用可在所有子分类器之间共享的标签无关行嵌入TabICL 能高效扩展到大量类别。图 8 显示 TabICL 在这些数据集上仍取得第二好的结果以平均归一化准确率计而 TabPFNv2 无法原生处理超过 10 个类别。图 8. 12 个超过 10 个类别的数据集的归一化准确率。颜色标识树基模型绿色、深度学习模型粉色、检索模型灰色、Transformer橙色和上下文模型蓝色。5.3. 消融研究基于树的 SCM 被证明有益。在预训练期间纳入树基模型的归纳偏置提高了 TabICL 的性能如图 9 所示。课程学习有效提高 TabICL 在大型数据集上的性能。在课程学习的三个阶段中TabICL 的平均排名从 11.4第九名提高到 7.46第二最终提高到 6.95第一如图 E.2 所示。这些结果显示了课程学习的有效性。然而我们也观察到在课程学习期间某些小型数据集上性能略有下降如图 10 所示。图 9. TabICL 在包含与不包含基于树 SCM 的先验数据集上预训练的相对改进跨 200 个数据集。绿色三角形表示平均相对改进。为减轻计算开销我们按照课程学习的阶段 1 设置预训练 TabICL 20K 步。图 10. 跨 200 个分类数据集相对于阶段 1 的相对准确率改进。绿色三角形表示平均相对改进。6. 结论我们介绍了 TabICL一种新颖的表格基础模型将现有表格基础模型的可扩展性扩展了一个数量级。在多达 100K 训练样本的数据集上评估它无需超参数调优即可提供出色性能比其他需要超参数调优的表格方法快近两个数量级。TabICL 通过混合架构和节省内存的优化实现了这一点。与新发布且领先的表格基础模型 TabPFNv2 相比TabICL 在保持相当性能的同时更具可扩展性和更快。局限性1与其他基础模型一样TabICL 存在推理速度慢的问题尽管 TabPFNv2 已表明缓存可以缓解这一问题。目前TabICL 仅限于分类但回归可以用类似方法处理如 Hollmann 等2025所示。2表格数据的一个定义性特征是列没有自然顺序。理想情况下表格方法应对列置换不变。然而由于使用 RoPETabICL 违反了这一不变性。3我们的评估继承了 TALENT 基准的优点和缺点。值得注意的是TALENT 训练使用留出法调优的单一模型而使用交叉验证评估的集成模型可以提高性能。Bagging 增加计算成本而 TabICL 可以简单地在全数据上训练而无需验证集。4TALENT 采用均值插补处理缺失值。然而尽管 TALENT 中缺失值比例较低允许 TabPFNv2 内部处理缺失值可能更好。5我们没有向 TabPFNv2 提供分类信息。虽然 TabPFNv2 内部推断分类特征但显式提供此信息可能增强其性能。展望表格数据的上下文学习最初是作为小型表格的加速方法引入的Hollmann 等2022。由于 Transformer 中单次前向传播的表达能力似乎有限人们可能会想在数据充足的情况下上下文学习是否会失去优势。我们发现即使在大数据情况下预训练诱导的隐式先验也使上下文 Transformer 具有竞争优势。