ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ARIS 跨阶段发现日志实战:用 FINDINGS_TEMPLATE 沉淀研究洞察与工程经验

ARIS 跨阶段发现日志实战:用 FINDINGS_TEMPLATE 沉淀研究洞察与工程经验 ARIS 跨阶段发现日志实战用 FINDINGS_TEMPLATE 沉淀研究洞察与工程经验【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep本文以 ARISAuto-Research-In-Sleep开源仓库中的 FINDINGS_TEMPLATE.md 为核心系统讲解findings.md作为跨阶段发现日志的设计动机、双分区结构研究发现 / 工程发现、条目编写规范以及它在 ARIS 自动评审循环、会话恢复与实验管理中的真实调用关系。读完本文你将能独立搭建并维护一份可持续支撑多会话、多轮自动评审的研究发现日志。为什么需要一份跨阶段发现日志ARIS 的实验流程以小时甚至整夜为单位运行idea 发现、自动评审循环review → fix → re-review、GPU 上过夜训练。在这个过程中实验会产生大量对后续决策至关重要、却又不该写进正式实验报告的发现某个模块在什么数据规模下有效、什么规模下无效某个 loss 组合在什么条件下梯度爆炸某个 baseline 官方代码复现不出论文数字的根因。FINDINGS_TEMPLATE.md 的头部注释把这份文件定位为Cross-stage discovery log跨阶段发现日志记录实验中学到的一切——既有关于方法与结论的研究洞察也有来自调试的工程教训。它的存在理由很直接没有中央日志这些发现就会在会话之间丢失下一个会话要么重复同样的错误要么错过关键信号。因此模板明确要求条目保持简洁keep entries concise并强调每次会话恢复时都要读取这份文件。它不是形式主义文档而是 ARIS 会话连续性的核心数据源之一。模板骨架一个文件、两个分区FINDINGS_TEMPLATE.md的全部结构只有两个顶层分区分别对应两类不同性质、不同读者、不同写入时机的发现# Research Findings ← 方法层面的洞察claims、实验设计、论文叙事 # Engineering Findings ← 基础设施、环境、调试教训防止未来重复排障两个分区各有一段语义说明Research Findings方法层面的洞察——什么有效、什么无效、为什么。这些直接为你的 claims、实验设计和论文叙事提供输入These directly inform your claims, experiment design, and paper narrative。Engineering Findings基础设施、环境与调试教训防止未来会话重复调试同样的问题Prevents re-debugging the same issues in future sessions。分区之间用---分隔。每个分区内的条目都以## [YYYY-MM-DD] 主题的日期标题开头——日期是时间索引主题是检索入口两者共同保证文件可以按时间顺序持续追加而不需要重排。Research Findings从数字到决策的完整链条模板为研究发现给出了 4 个示例条目它们共同展示了发现 → 假设 → 影响/决策的完整记录范式。示例一注意力模块在小数据集上无效## [YYYY-MM-DD] Example: Attention module ineffective on small datasets - Our proposed attention mechanism shows no improvement on CIFAR-10 (acc 93.1 vs baseline 93.0) but 2.3% on ImageNet - Hypothesis: the module needs sufficient spatial diversity to capture meaningful patterns; small-resolution inputs dont provide this - Implication: restrict claims to medium/large-scale datasets这个条目示范了三条信息如何构成一条高质量研究发现Finding发现量化的对比结果带具体数字acc 93.1 vs 93.02.3% on ImageNet不写模糊的有些提升Hypothesis假设解释现象背后机制的推测为后续实验设计指明方向Implication影响直接落到行动——限制 claims 的适用范围防止在论文中过度推广。示例二loss 组合导致梯度爆炸## [YYYY-MM-DD] Example: Loss combination causes gradient explosion - Combining L_contrastive L_distill with equal weight → gradient norm 1000 after epoch 5 - Root cause: L_contrastive scale is ~10x larger than L_distill; needs rebalancing or gradient clipping - Decision: weight ratio 0.1:1.0, gradient norm stable at ~5.0 after fix这一条展示了问题 → 根因 → 决策及验证的记录方式现象梯度范数 1000、根因定位两 loss 量级差 10 倍、以及修复决策与修复后验证权重比 0.1:1.0梯度范数稳定在 ~5.0。决策后的量化验证尤其重要它让后来的会话可以直接复用这个结论而不必重新试错。示例三关键决策——放弃多尺度方案## [YYYY-MM-DD] Example: Key decision — dropped multi-scale approach - Multi-scale variant adds 40% compute but only 0.3% accuracy over single-scale - Not worth the complexity; claim reframed around efficiency rather than raw performance这条示范了**不做什么同样值得记录**多尺度方案代价是 40% 算力、收益仅 0.3% 精度因此决策放弃并把论文叙事从性能重构为效率。这类条目防止未来会话在同一个岔路口反复纠结。Engineering Findings让调试经验可复用工程发现分区包含 3 个示例覆盖三类高频工程问题。示例一梯度累积导致 OOM## [YYYY-MM-DD] Example: OOM with gradient accumulation - OOM on batch_size32 with 4x GPU — gradient accumulation was doubling peak memory - Fix: enabled gradient checkpointing; batch_size32 now fits in 24GB记录问题与根因梯度累积使峰值显存翻倍已应用的修复开启 gradient checkpointing32 的 batch size 在 24GB 显存上可行。修复后的可复现状态让任何会话都能直接引用。示例二baseline 复现差距## [YYYY-MM-DD] Example: Baseline reproduction gap - Paper reports 95.5 on dataset-X; we get 93.2 with their official code - Root cause: different data preprocessing (center crop vs resize-then-crop) - Decision: use our preprocessing for fair comparison, document in paper这条示范如何记录论文数字与本地复现不一致这类经典问题现象95.5 vs 93.2、根因预处理差异center crop vs resize-then-crop、决策统一使用自己的预处理并写进论文。它同时提示复现差距往往不是玄学而是预处理、超参或数据切分的差异找到根因后要落到明确决策。示例三WandB 日志破坏 DDP## [YYYY-MM-DD] Example: WandB logging breaks DDP - wandb.log() inside DDP forward pass causes hanging on multi-GPU - Fix: wrap in if dist.get_rank() 0 guard问题 修复代码级示例多卡训练中在 forward pass 内调用wandb.log()会导致挂起修复方式是用if dist.get_rank() 0包裹。这类环境特性型发现是典型的跨会话高频踩坑点值得第一时间沉淀。条目编写规范何时写、写什么综合模板本身与 docs/PROJECT_FILES_GUIDE.md 的约定findings.md的编写遵循以下规则触发时机实验、调试或分析中发现非预期现象时立即追加As discoveries happen (append)不要攒批、不要等稍后一条一行每条发现保持一句话量级可附带证据wandb run、指标、数据集日期标题## [YYYY-MM-DD] 主题按时间追加无需重排证据字段研究发现条目保留- Evidence (wandb run, metric, dataset)占位提示每个结论都应能追溯到可验证的证据源追加重于编辑findings.md是追加型append-only文件不采用时间戳版本化命名——它在 docs/PROJECT_FILES_GUIDE.md 中被明确归类为 Not timestamped: append-only files (findings.md)。与其他项目文件的分工边界findings.md只是 ARIS 项目状态文件家族中的一员docs/PROJECT_FILES_GUIDE.md 给出了清晰的职责划分问题写入文件实验 X 正在运行 去哪里EXPERIMENT_TRACKER.md实验 X 得到了 accuracy 95.2 去哪里EXPERIMENT_LOG.mdlr1e-4 在 dataset-X 上发散 去哪里findings.md评审人要求补消融 去哪里review-stage/AUTO_REVIEW.md因为 Z 选择了方案 A 而非 B 去哪里findings.md当前阶段是 training 去哪里CLAUDE.mdPipeline Status它与 EXPERIMENT_LOG_TEMPLATE.md 的分工尤其关键EXPERIMENT_LOG 是所有实验的完整记录——全部结果、配置、复现命令是我们实际跑了什么、发生了什么的权威来源而 findings 只记录非预期、有决策价值的发现。项目文件指南用一条数据流概括了这种关系EXPERIMENT_LOG.md 跑出了什么 — 完整结果 复现命令 ↓ 发现异常 findings.md 一句话记录 — 异常、根因、决策在 ARIS 工作流中的实际调用谁在读写 findings.md从仓库源码与技能定义看findings.md不是孤立文件而是被多个 ARIS 技能主动读写的工作流要素/auto-review-loop 的 compact 模式在 skills/auto-review-loop/SKILL.md 中COMPACT常量直接定义了对findings.md的双向使用置为true时会话恢复阶段读取findings.mdEXPERIMENT_LOG.md来替代完整日志与原始 log节省上下文窗口readEXPERIMENT_LOG.mdandfindings.mdinstead of parsing full logs on session recovery每一轮评审结束后向findings.md追加一行关键发现格式为- [Round N] [positive/negative/unexpected]: [one-sentence finding] (metric: X.XX → Y.YY)这一行式追加格式与模板一句话条目的基调完全一致每轮评审提炼出正/负/意外三类发现之一附指标变化区间供后续轮次和会话恢复快速定位。该技能还定义了一致的会话恢复顺序先检查review-stage/REVIEW_STATE.json决定是全新启动还是续跑再读取叙事文档、记忆文件与既有评审文档——其中 compact 模式下findings.md就是被优先读取的上下文来源之一。/ablation-planner消融完成后的落点skills/ablation-planner/SKILL.md 规定消融实验全部完成后用消融结果更新findings.mdAfter all ablations complete → update findings.md with insights。消融结论哪个模块贡献了多少是典型的不会进正式实验报告、但对 claims 至关重要的发现正是 findings 的预期内容。/analyze-results分析输出的第一落点skills/analyze-results/SKILL.md 在其文档更新步骤中要求发现显著时起草 1–2 句话的发现陈述Draft a concise finding statement (1-2 sentences)——与模板简洁的基调呼应其结果通常流向项目笔记与实验报告其中非预期、有决策意义的部分就进入 findings。会话恢复findings.md 的读取位置docs/SESSION_RECOVERY_GUIDE.md 定义了新会话或压缩context compaction后的标准读取顺序CLAUDE.md→## Pipeline Status30 秒定位当前阶段idea-stage/docs/research_contract.md当前 idea 的聚焦上下文findings.md最近条目最近发现了什么refine-logs/EXPERIMENT_LOG.md需要时跑过哪些实验。findings.md排在第 3 位紧跟在 Pipeline Status 和 research contract 之后——它的职责是把最近的发现与决策注入恢复的会话使 Agent 不必从头推理。这份约定不依赖任何框架正如该指南强调的整套机制只是 Markdown 约定在 Claude Code、Cursor、Trae、Codex CLI、OpenClaw 上均可工作。直接可用的落地模板将原模板结构化扩写后一份可直接复制到项目根目录的findings.md骨架如下保持模板原意补充了字段说明占位# Findings **Cross-stage discovery log.** Records what you learn during experiments — both research insights about your method/claims and engineering lessons from debugging. Read on every session recovery, so keep entries concise. **Why this file exists:** Experiments produce discoveries that are critical for future decisions but dont belong in formal experiment reports. Without a central log, these get lost between sessions — and the next session repeats the same mistakes or misses important signals. --- # Research Findings Method-level insights: what works, what doesnt, and why. These directly inform your claims, experiment design, and paper narrative. ## [YYYY-MM-DD] Topic - Finding带量化证据指标、数据集、wandb run - Hypothesis机制层面的推测指引后续实验 - Implication / Decision对 claims 或实验设计的直接影响 --- # Engineering Findings Infrastructure, environment, and debugging lessons. Prevents re-debugging the same issues in future sessions. ## [YYYY-MM-DD] Topic - Problem and root cause现象 根因 - Fix applied可复现的修复方式含关键参数使用建议与注意事项一条条目解决一个问题原模板的 7 个示例无一例外都是现象 根因/假设 决策/修复的单主题结构避免把多条无关发现塞进同一条日期标题证据可追溯研究条目保留 wandb run、指标、数据集等证据字段工程条目给出可复现的修复参数——两者都保证后续会话能独立验证包括负面结果模板明确把什么无效与什么有效并列记录示例一attention 无效和示例三放弃多尺度都是典型负面结果这与 skills/auto-review-loop/SKILL.md 中Be honest — include negative results and failed experiments的规则一脉相承追加不重排文件按时间顺序只增不改旧条目的历史价值大于其整洁度配套使用把findings.md与 CLAUDE_MD_TEMPLATE.mdPipeline Status、EXPERIMENT_LOG_TEMPLATE.md完整实验记录、RESEARCH_CONTRACT_TEMPLATE.md当前 idea 聚焦上下文配合使用即可构成完整的 ARIS 状态持久化体系——这也是 docs/SESSION_RECOVERY_GUIDE.md 建议的项目恢复栈。一份维护良好的findings.md本质上是在为你的 Agent 构建跨会话的科研记忆它让每一轮自动评审、每一次深夜实验的教训都成为下一轮决策的输入而不是消失在上下文压缩与新建会话之间。【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表