ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

8个实战场景:用 Codex Autoresearch 降延迟、提覆盖率、缩二进制、清零安全告警

8个实战场景:用 Codex Autoresearch 降延迟、提覆盖率、缩二进制、清零安全告警 8个实战场景用 Codex Autoresearch 降延迟、提覆盖率、缩二进制、清零安全告警【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearchCodex Autoresearch 是一款面向 Codex 的自主迭代实验技能你只需说出一个可度量的目标比如把 p95 延迟降到 200ms 以下或把安全告警清零它就会自动进入修改 → 验证 → 保留或回滚 → 重复的循环直到指标达标为止。整个过程由 Git 提交作为实验记忆失败改动自动git revert成功改进永久保留。它受 Karpathy 的 autoresearch 概念启发专为软件仓库设计Codex 负责提出假设和改代码内置控制脚本负责测量、提交、回滚和状态记录——两者职责严格分离这也是它值得信任的关键。快速安装两步开始使用安装不需要修改任何 Codex 配置只需两步详见 docs/INSTALL.md在 Codex 中运行技能安装器一条命令完成安装打开一个干净的 Git 仓库需 Full Access 权限因为它要为每次实验创建/回滚提交输入$codex-autoresearch即可唤起。 环境要求当前版本的 Codex CLI带 Skills 和 Goals 能力、Python 3.11、Git以及一个干净且有名字的分支。启动前Codex 会先与你确认 7 项配置目标、可修改范围、指标名称、方向越小越好还是越大越好、验证命令、目标值、回归护栏。没有你的明确批准它不会写任何文件。8个实战场景从修复测试到夜间长跑以下场景均出自官方示例文档 docs/EXAMPLES.md覆盖了日常开发中最常见的优化诉求。场景1失败用例清零最经典的入门用法目标把score.py报告的error_count从 5 降到 0同时保持 pytest 通过。$codex-autoresearch 把 python3 scripts/score.py 的 error_count 降到 0保持 pytest 通过Codex 会自动扫描仓库确认范围、验证命令和护栏后开始循环。每次尝试若指标未改善或护栏失败自动回滚改善则保留提交。适合先小目标练手。场景2清零 TypeScript 类型错误目标在不改动生成代码的前提下消除src下的所有类型错误。$codex-autoresearch 消除 src 下的 TypeScript 错误不要改动生成的 client技巧用一个项目自己维护的计数脚本输出错误数量比让 AI 去解析编译器冗长输出更稳定可靠。场景3提升测试覆盖率到 90%目标把src/auth的分支覆盖率提到至少 90%且要求是有意义的测试。$codex-autoresearch 把 src/auth 的分支覆盖率提升到至少 90%这里的分工很巧妙覆盖率是指标完整测试套件是护栏——防止 Codex 为了刷数字写出无意义的测试。场景4降低接口延迟p95 200ms目标在不改变响应结果的前提下把搜索基准测试的 p95 延迟降到 200ms 以下。$codex-autoresearch 把搜索基准的 p95 降到 200ms 以下不改变响应⚠️关键提示启动前务必先稳定基准环境固定 fixture、预热、样本量、机器负载。噪音很大的基准会产生不可信的保留/丢弃决策这是延迟优化场景最容易踩的坑。场景5多指标调度器优化带约束的提分目标把调度器的judge_score提到 0.80 以上同时硬冲突数保持为 0。$codex-autoresearch 把 judge_score 提到至少 0.80同时硬调度冲突保持为 0验证命令可以输出多个数字字段用于诊断但只有指定键驱动保留/丢弃决策护栏则负责约束可行性。适合任何带硬约束的提分任务。场景6压缩二进制体积目标在全部测试通过的前提下把 release 二进制压缩到 12MB 以下。$codex-autoresearch 把 release 二进制压到 12MB 以下且所有测试通过# 验证命令示例构建并测量 cargo build --release --quiet python3 scripts/binary_size_mb.py注意验证命令可以产生构建产物但不能修改 Git 跟踪的项目文件构建输出应放在被忽略的目录里。场景7清零安全扫描告警目标把src/api中确定性扫描器的 critical 告警数降到 0。$codex-autoresearch 把 src/api 中确定性的 critical 告警数降到 0⚠️ 只适用于数字输出稳定的扫描器或测试框架。主观性很强的安全审计更适合当普通 Codex 任务来做——Autoresearch 需要机械可重复的指标。场景8夜间后台长跑 随时接管目标把 lint 警告清零让它在后台通宵跑。# 启动后台运行 $codex-autoresearch 把 lint_warning_count 降到 0 # → 选择 Background with Full Access确认后即可去做别的事 # 第二天查看进度 / 停止 / 带新方向恢复 $codex-autoresearch show status $codex-autoresearch resume; 生成文件是权威的不要改它们后台模式会为每次迭代启动独立 worker前台任务无需轮询。前景模式则配合 Codex Goal 支持暂停/恢复可随时插入你的策略方向。两种模式的实验规则完全一致详见 docs/GUIDE.md。运行产物每一步都可追溯所有运行状态都在autoresearch-results/目录下且永远不会被提交文件作用run.json不可变的已确认配置events.jsonl追加式的实验历史唯一事实来源logs/完整的验证、护栏、worker 输出report.html可视化快照可重新生成想复盘或分享时直接对技能说一句话即可$codex-autoresearch show experiment history # 终端表格 $codex-autoresearch export experiment history as TSV # 导出表格 $codex-autoresearch generate an HTML report # 生成可视化报告HTML 报告包含指标轨迹图、保留/丢弃时间线、提交记录和日志链接方便贴进周报或 PR 描述。为什么它比让 AI 一直改更可靠安全模型是这个项目的灵魂详见 SKILL.md 与 scripts/autoresearch.py✅每次尝试都是一个 Git 提交成功保留、失败回滚全程可追溯✅越界编辑、分支变更、指标格式错误、命令失败、超时——任何异常都会带精确错误和日志路径立即停止绝不静默恢复✅只有指标达到确认目标才报告 complete从不猜测结果✅ 严格的容错哲学静默恢复让长期自主运行无法被信任。新手避坑清单常见问题官方建议为什么需要 Full Access每次迭代要创建/回滚 Git 提交受限沙箱可能拦截.git写入没有 Git 能用吗跨多个仓库不能。Git 是实验记忆和回滚边界一个仓库一个运行只能做小改动吗不是。一个实验对应一个连贯假设大小由假设决定但要可独立测量和回滚能中途停止吗可以。前景暂停 Goal 即可后台通过$codex-autoresearch查看状态、停止或带新方向恢复什么任务不适合主观设计、一次性迁移、发布部署——用普通 Codex开放式目标先和 Codex 一起定义稳定基准总结什么时候用 Codex Autoresearch一句话判断你的目标能否用一个命令输出一个数字来衡量✅ 能 → 用 Autoresearch零失败用例、≥90% 覆盖率、p95 200ms、二进制 12MB、安全告警清零……❌ 不能 → 先用普通 Codex 把基准搭起来再交给它自主迭代。更多实战 prompt 与指标脚本写法参考 docs/EXAMPLES.md完整生命周期与故障排查见 docs/GUIDE.md。现在就把一个积压已久的优化目标丢给它去睡一觉吧 【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表