全部技能 / 基础工具与工作流 / auto-research-in-sleep
基础工具与工作流 · wanshuiyin/Auto-claude-code-research-in-sleep

auto-research-in-sleep

Full end-to-end research pipeline: from a broad research direction through idea discovery, experiments, and review all the way to a polished paper PDF. Use when user says \"全流程\", \"full pipeline\", \"从找idea到投稿\", \"end-to-end research\", or wants the complete autonomous research lifecycle.

风险提醒:橙色 · 评估后使用AI 侦查报告
作者 wanshuiyinGitHub wanshuiyin/Auto-claude-code-research-in-sleep ↗Stars 16146许可 MIT(仓库根 LICENSE,Copyright (c) 2026 wanshuiyin)commit 15b9b27de6
agent 宿主通常会约束 skill 执行权限;风险提醒为 AI 侦查观点,不构成质量或安全保证。第三方 skill 仅作拆解与展示,安装使用风险自负,版权归原作者。

1实现原理 · 为什么它能做到

整个产品不是可执行程序而是 82 个 Markdown『技能』(SKILL.md):安装即把每个技能目录软链到项目的 .claude/skills/<name>,靠宿主 CLI 的斜杠命令发现机制装载,行为全部由 prompt 编排 + 少量确定性脚本兑现。

README.md
bash Auto-claude-code-research-in-sleep/tools/install_aris.sh ~/your-project # symlinks ARIS skills into <project>/.claude/skills/
注:这里在做什么:把『技能』做成宿主无关的纯文本资产(同一套 SKILL.md 同时服务 Claude Code / Cursor / Trae / Antigravity / Copilot CLI,Codex 另有一份 skills/skills-codex/ 镜像)。装/卸走 tools/install_aris.sh + .aris/installed-skills.txt 清单,只动自己装的条目。

旗舰入口 /research-pipeline 把五个阶段串成一条链(idea-discovery → experiment-bridge → auto-review-loop → summary → paper-writing),每个阶段的执行状态与『验收状态』分开落盘到 .aris/runs/<run_id>.json,因此中断后可续跑而不是重来。

skills/research-pipeline/SKILL.md
- **RESUMABLE = true** — When `true` (default), the pipeline records per-stage state to `.aris/runs/<run_id>.json` so a crashed/interrupted run can resume via `/research-pipeline — resume <run_id>` instead of restarting. Stage status splits `done` (executor finished writing) from `accepted` (the stage's cross-model gate / deterministic verifier passed); resume re-validates any `done`-but-unaccepted stage. See `shared-references/resumable-runs.md`.
注:续跑语义是这套东西的核心设计:done=执行器自己说写完了(可同模型自评),accepted=必须由跨模型评审或确定性校验器给出,续跑从第一个非终态阶段开始,所以『写完了但还没验收』的阶段会被重新审计而不是被跳过。

『睡觉跑』的形态是:Stage 1 白天/傍晚做选题,Stage 2-3(实现实验 + 自主评审循环)无人值守跑;Stage 3 就是 /auto-review-loop 内部自带的多轮循环(默认 4 轮、分数≥6 且 verdict∈{ready,almost} 才停),不需要外部定时器。

skills/research-pipeline/SKILL.md
**Sweet spot**: Run Stage 1 in the evening, launch Stage 2-3 before bed, wake up to a reviewed paper.
注:同文件 Key Rules 另写明『- **Stages 2-3 can run autonomously** once the idea is selected. This is the "sleep and wake up to results" part.』;停止条件在 skills/auto-review-loop/SKILL.md 的常量里(MAX_ROUNDS = 4 与 POSITIVE_THRESHOLD 的 AND 双条件)。

对『外部定时器』有明确的宪法级约束:定时/心跳只能负责何时唤醒与推进工作,永远不能判定工作好坏;心跳若发现停滞只允许改变结构方向或升级给人,不允许宣布『够好了』。

skills/shared-references/external-cadence.md
One-liner: **a heartbeat may say "keep going," never "good enough."**
注:同一文档用表格区分『等待外部事实(加性、可挂 /loop)』与『包住内部语义循环(有害、禁止)』,并点名 /auto-review-loop、/experiment-queue 不得被外部循环包住(会丢 reviewer 线程记忆 / 与其自带 60s 调度器打架)。这是很多同类『自主 agent』项目缺失的自我约束层。

无人值守时的存活与监控靠确定性守护进程:GPU 服务器上跑一个只用标准库 + nvidia-smi 的 watchdog 守护,按任务类型产出 DEAD/IDLE/STALLED/STALE 告警,并汇总成 summary.txt 供低频轮询。

docs/WATCHDOG_GUIDE.md
A lightweight Python daemon that runs on each GPU server, continuously monitoring all registered tasks. Zero dependencies beyond Python 3 standard library + `nvidia-smi`.
注:本地侧另有自带 aris-monitor(纯 stdlib Tkinter 常驻悬浮窗),只读 ~/.claude/sessions/<pid>.json 的 status=="waiting" 判断哪个会话卡在权限确认上,README 自述 '**No network calls, ever.**'(唯一非读动作是点击行时 raise-only 唤起终端窗口)。

『为什么评审算数』的机制是跨模型陪审团:执行器(Claude / Codex / Cursor / Antigravity / Copilot CLI)写代码写论文,审查器必须是另一家族模型(Codex MCP 的 GPT-6-Astra、或 claude-review / gemini-review MCP、或 Copilot 原生 rubber-duck),并且每条评审调用的线程/追踪 id 会被留档。

AGENT_GUIDE.md
Executor (Claude / Codex / Cursor / Antigravity / Copilot CLI) writes code & papers; reviewer (GPT-6-Astra via Codex MCP, Claude / Gemini via `claude-review` / `gemini-review` MCP, or Copilot's evidence-gated native complementary reviewer for `/auto-review-loop`) critiques independently.
注:默认路由与努力档位写在 skills/shared-references/reviewer-routing.md:常规调用 gpt-6-astra + xhigh,深度审计类技能(/proof-checker、/kill-argument、/paper-claim-audit、/experiment-audit 等)用 ultra,并要求每次首调用显式钉住 model 与 model_reasoning_effort。

『模型混搭层』是双层的:执行器走宿主自己的 ANTHROPIC_* / 各厂商兼容端点环境变量,审查器走随仓库发布的 MCP 桥(llm-chat / minimax-chat / gemini-review / claude-review),于是执行与审查可以用完全不同的厂商与密钥。

docs/LLM_API_MIX_MATCH_GUIDE.md
本指南说明如何自由搭配 Claude Code 执行器和外部审查器的 API。
注:同一文档给出可复制的 mcpServers 配置片段(例:llm-chat 的 env 里填 LLM_API_KEY + LLM_BASE_URL=https://api.deepseek.com/v1 + LLM_MODEL=deepseek-chat),并列出 Z.ai/Kimi/LongCat/自定义兼容端点等执行器侧组合;/auto-review-loop-llm 与 /auto-review-loop-minimax 就是这套审查器后端的现成入口。

真正跑实验的部分靠 Bash 直接指挥远程/租用算力:ssh + rsync + screen 部署,或 vast.ai 租实例(含自动销毁与预算提示)、或 Modal 无服务器 GPU;判据来自项目 CLAUDE.md 里的 gpu: local|remote|vast|modal。

skills/run-experiment/SKILL.md
- **Vast.ai** (`gpu: vast`): Check for `vast-instances.json` at project root — if a running instance exists, use it. Also check `CLAUDE.md` for a `## Vast.ai` section.
注:vast-gpu 技能负责挑选与生命周期(vastai search offers / create instance / destroy instance,实例清单写在项目根 vast-instances.json);serverless-modal 负责 Modal(modal run 本地发起、按秒计费、scale-to-zero)。monitor-experiment 回读 screen hardcopy / 结果 JSON / W&B 曲线。

给 agent 看的仓库入口是 AGENT_GUIDE.md(面向 LLM 的结构化路由索引),并显式声明『SKILL.md 才是规格,指南与 SKILL.md 冲突时以 SKILL.md 为准』——降低长仓库里的叙事漂移。

AGENT_GUIDE.md
> **Source of Truth.** This file is a *routing index*, not a specification.
注:同一份指南给出平台→技能根目录对照表(Claude/Cursor/Trae/Antigravity/Copilot 用 skills/<name>/SKILL.md,Codex 用 skills/skills-codex/<name>/SKILL.md),把多宿主适配做成了镜像目录而非分叉代码。

2核心能力

01端到端自主科研流水线(选题→实验→评审→成稿),单命令 /research-pipeline 串起 5 个阶段
02可续跑的无人值守评审循环:默认 4 轮、达标即停、崩溃后按状态文件恢复
03跨模型对抗式审查:可路由 Codex/GPT-6-Astra、Claude、Gemini、任意 OpenAI 兼容模型、MiniMax、Copilot 原生 rubber-duck、或人工(manual)后端
04远程/租用 GPU 实验执行与监控(SSH 服务器、vast.ai 按需租机并自动销毁、Modal 无服务器、多作业队列 + watchdog 守护)
05多源文献与新颖性核查(arXiv / Semantic Scholar / OpenAlex / DeepXiv / Exa / Gemini / 本地 PDF / Zotero / Obsidian 交叉去重)
06反幻觉引用链:不凭记忆写 BibTeX,改用 DBLP/CrossRef 真实检索,失败则打 [VERIFY] 标记
07持久研究记忆 Research Wiki:论文/想法/实验/主张入图并跨研究生命周期累积(失败想法为最高保留级,永不裁剪)
08移动端通知与『人在环上』审批:飞书 webhook 推送 + 交互式批准/驳回,另有零 API 成本的人工审查后端

3外部依赖

类型依赖
clicodex(OpenAI Codex CLI,`codex exec` 子进程)
clivastai(vast.ai 租机 CLI)
climodal(Modal 无服务器 GPU)
clissh / rsync / screen / nvidia-smi(远程 GPU 服务器部署与巡检)
clirsync 代码同步(远端部署路径之一)
cliLaTeX 工具链(latexmk / pdfinfo / pdffonts,论文编译与体检)
apiAnthropic 兼容端点(执行器侧,可用官方或第三方兼容网关)
apiOpenAI 兼容 LLM API(llm-chat MCP,可指向 OpenAI/DeepSeek/Kimi/MiniMax/自建兼容端点)
apiDeepSeek(经 llm-chat 作为审查器后端)
apiMoonshot / Kimi(经 llm-chat 作为审查器后端)
apiMiniMax Chat(minimax-chat MCP,/auto-review-loop-minimax 的专用后端)
apiGoogle Gemini(gemini-review MCP,直接 API 生成端点)
apiFeishu / Lark 机器人 webhook(推送通知)
apiExa 搜索 API(exa-py SDK;/exa-search 与 /research-lit 的 sources: exa)
apiSemantic Scholar Graph API(论文检索)
apiOpenAlex API(引用图谱检索)
apiarXiv(元数据 API + PDF 下载)
apiCrossRef / DBLP(真实 BibTeX 校验,反幻觉引用)
apiWeights & Biases(训练曲线回读;由 monitor-experiment / training-check 调用)
apiOverleaf Git 桥(论文双向同步,凭 keychain/token)
network本地 HTTP 服务(人工审查 MCP 在 127.0.0.1 开浏览器审批页;飞书桥默认 5000 端口)
packagelark-oapi(Python 飞书 SDK,feishu-bridge 依赖)
packagehttpx(llm-chat / minimax-chat 的 HTTP 客户端)
packagedeepxiv-sdk(可选:渐进式论文阅读技能 /deepxiv)

4风险提醒 风险提醒:橙色 · 评估后使用

风险提醒:橙色 · 评估后使用
  • 夜间免打扰配置会显著放大无人监督时的执行权限 — README 直接教用户在 .claude/settings.local.json 放行 mcp__codex__codex / mcp__codex__codex-reply / Write / Edit / Skill(auto-review-loop),配合技能声明的 Bash(*) 工具面,等于让 agent 在你睡觉时无需确认地写文件、跑 shell、调外部模型。风险不在 skill 有恶意,而在『错误判断 + 无人在场 + 无确认』三者叠加时的损失上限(覆盖项目文件、在远程机器上执行、持续消耗 API 与 GPU 预算)。建议把放行范围缩到具体命令、保留 human checkpoint 或飞书审批。
  • 凭证集中在一个自动化管道里,泄露爆炸半径大 — 同一套流程会接触执行器/审查器 API key(Anthropic/OpenAI/DeepSeek/Kimi/MiniMax/Gemini)、Exa、W&B、Codex 与 Gemini 本地配置、飞书 App Secret、vastai 与 Modal 的 token、Overleaf token;任一处被写进日志、通知卡片或被提示注入诱导外泄,影响面跨多个付费账号。仓库已做部分防护(.env 入 .gitignore、通知规则禁止带密钥、overleaf_audit.sh 扫泄漏、gemini env 文件做属主/权限校验),但用户自建的 settings.json 与远程机器上的 .env 仍需自行收紧。
  • 远程机器与租用算力的数据/成本边界由用户自己兜 — 技能会把项目代码 rsync 到用户服务器、在 vast.ai 新租的实例上 apt/pip 安装依赖并执行用户代码;vast.ai 默认 auto_destroy 但可关,max_budget 是可选提示而非硬闸;Modal 文档自己也提醒不要在 CLI 输入付款信息。无人值守跑偏(例如实验脚本错误地重复启动)直接转化为真金白银。
  • 注入面真实存在且只能被『降低』而非消除 — 论文摘要、网页正文、评审返回文本、社区 PR 的 SKILL.md、研究记忆节点都会被回灌进上下文。threat_scan 是正则层(文档自认『干净扫描≠安全』),语义投毒只能靠跨模型 reviewer 兜;且其对 web/tool 内容默认只 warn,真正的 block 只在用户可介入的写入路径生效。
  • 体量与耦合度带来的可维护性成本 — 1794 行 README + 82 技能 + 63 测试 + 40 个 tools 脚本 + 24 份契约文档,且大量行为通过四层 helper 解析链在『技能散文 → 脚本』之间耦合;仓库自己记录了多起因 prose-only 集成静默失效的事故(integration-contract.md 开头的两个 bug)。用户若想裁剪到只用一两个技能,需要理解这套约定才不会踩到静默失败。
  • 『自主科研』产出的可信度仍需人来把关 — README 自己声明高分是 AI-review 循环的预期副产品('high AI scores are an expected byproduct, not proof of acceptance'),社区展示的分数来自 CSPaper / Stanford Agentic Reviewer 等 AI 信号而非录用结果。把它当作效率放大器可以,当作成果背书不行。
风险提醒:橙色,评估后使用。它不是纯 prompt 技能,而是一整套会动真格的执行环境:① 直接读取/使用大量 API 凭证与本地凭据文件(ANTHROPIC_*、LLM_*、MiniMax、Gemini、Exa、W&B、~/.codex/config.toml、~/.gemini/.env、~/.claude/feishu.json、~/.modal.toml、vastai key、Overleaf keychain);② 依赖并安装远程包与远程服务(pip install vastai/modal/exa-py/deepxiv-sdk、lark-oapi、httpx;SSH 到用户服务器并 rsync/安装依赖;租用 vast.ai/Modal 并按小时计费);③ 以 Bash(*) 全域工具面执行任意实验脚本、ssh/rsync/screen、git 与 curl,且在 README 指导下可配置成夜间免确认自动放行;④ 渲染/执行链路上对第三方内容(论文、网页、评审返回、社区 SKILL.md)做二次注入。之所以不落红色:仓库本身没有安全降级(不禁用 TLS、不做反爬绕过、不批量定向采集),执行的都是用户自己的实验代码;反而内置了相当罕见的自我约束(acceptance gate 禁止自评验收、reviewer 独立性、external cadence 禁止用定时器判定质量、threat_scan 注入扫描、vast.ai auto_destroy/max_budget、Modal 明确警告不要在 CLI 里输付款信息、人工审查与飞书批准通道、默认 human checkpoint 开关)。结论:风险来自『自动化科研基础设施』的固有接触面与凭证集中,而非恶意行为;橙色 = 知情配置后再用(尤其注意免打扰 allow 列表的范围与远程机器的数据边界)。

5第二遍独立确认

  • [ok] skill.path 定位(旗舰入口选择) — 候选与判据:① 仓库根——glob 确认无 SKILL.md、无 plugin.json/.claude-plugin 清单,且 skills/ 下是 82 个平级技能目录(多入口多技能插件),按共享路径规则不取根;② skills/research-pipeline——README 快速开始的单命令总入口写的是 `/research-pipeline "your research direction" # Full pipeline: Workflow 1 → 1.5 → 2 → 3 end-to-end`,docs/SKILLS_CATALOG.md 的『🏗️ Workflow Orchestrators』一节以 '**Most users start here.**' 开头并把 /research-pipeline 列为第一条('**Full chain** — Workflow 1 → 1.5 → 2 → 3, from research direction to submission-ready paper'),AGENT_GUIDE.md 亦写 'Main chain: /research-pipeline = W1 → W1.5 → W2 → W3'——三处独立证据一致指向它;③ skills/idea-discovery(W1)与 skills/auto-review-loop(W2,『睡觉跑』本体)——都是它的下游子技能,按『never a sibling sub-skill』规则不取。结论:取 skills/research-pipeline 作为旗舰条目。
  • [ok] pin commit 与本地工作副本一致 — git rev-parse HEAD 输出 15b9b27de6e265a058e875bbf15b09bf8a522aa3,与任务给定 pin 逐字符相同;未执行任何写操作。
  • [ok] license 元数据 — 仓库根 LICENSE 首行 'MIT License'、'Copyright (c) 2026 wanshuiyin',与任务给定 MIT 一致。
  • [ok] 『82 skills』声明的真实性 — skills/ 下 86 个目录 − 4 个非技能目录(shared-references 与三个 skills-codex* 镜像/叠加层)= 82,与 README:612 与 docs/SKILLS_CATALOG.md 的 82 完全对齐;README 顶部另一处提到 '81 bundled skills' 指的是 ARIS-Code CLI 二进制内置包,与本仓库 main 树的 82 个目录不是同一口径,已在结论中按 main 树口径采信。
  • [ok] 外部依赖:codex 审查器确实是本地子进程而非文档承诺 — mcp-servers/codex-exec/server.py 源码含 `argv = [CODEX_BIN, "exec"]`、`subprocess.Popen(argv, ...)`、`shutil.which(CODEX_BIN)`,且 CODEX_BIN 默认为 'codex';README/AGENT_GUIDE 关于『codex-cli 0.154 删除 codex mcp-server 后由本仓库自带桥接管』的叙述与代码一致。
  • [ok] 外部依赖:审查器端点逐个可定位 — LLM(llm-chat)、MiniMax、Gemini 三处端点均来自各自 server.py 的 os.environ 默认值或请求构造行;Exa 走 SDK(仅 EXA_API_KEY + exa-py 可见,无硬编码域名,已在 endpoint 字段标明 exa.ai 而非杜撰 API 路径);arXiv/CrossRef/S2/OpenAlex 均命中 tools/*.py 的常量。
  • [discrepancy] 凭证读取:是否存在未披露的密钥读取 — 第一遍只列了环境变量与 ~/.gemini/.env、~/.claude/feishu.json。第二遍补到三处未在首轮列出的读取面:① ~/.codex/config.toml(README 明确 reviewer 模型来源,属读取用户 LLM 凭证/配置);② ~/.modal.toml 与 vastai 的 API key 文件(serverless-modal / vast-gpu 技能要求);③ 全局指针 ~/.aris/repo 与项目 .aris/installed-skills.txt(被技能 bash 块读取以解析 helper 路径)。三者均为『本地配置/凭证文件读取』,已并入 security.credential_reads,结论档位不变(橙色本就因凭证接触面)。
  • [ok] 注入面:是否真的做了防御而非只在文档里写 — tools/threat_scan.py 实现存在(regex、scope all/context/strict、quarantine 返回占位符 + findings),且 skills/idea-creator/SKILL.md 的 'ARIS_QUERY_PACK_SCAN_START … END' bash 块真的解析并调用它、扫描失败时跳过 wiki 上下文;skills/shared-references/injection-hygiene.md 给出『干净扫描≠安全』与分档 warn/block 规则。防御是落地的,不是宣言。

6结论

  • 把『自主跑一夜』做成有状态、可续跑、可验收的工程,而不是一次长对话:五阶段状态机 + done/accepted 双状态 + 定时心跳只推进不判定。
  • 跨模型对抗审查是默认纪律而非可选项:执行与审查必须不同家族,同家族只能记 provisional,每条评审调用留线程/追踪 id,深度审计类技能强制 ultra 档推理。
  • 覆盖面罕见地宽:82 个可组合技能贯通文献→选题→实验→评审→成稿→反驳→重投→报告,还附带专利、证明工程、口试速查等旁支,且支持 7 种宿主。
  • 真算力落地:本地/远程 SSH/vast.ai/Modal 四条 GPU 路径 + 多作业队列 + watchdog 守护 + 成本提示与自动销毁,实验是真跑而不是模拟。
  • 对自身风险有自觉并落了代码:注入扫描器 + 隔离占位符、证据预检、来源授权(provenance)、自我改进的落地闸门(仅 /meta-apply 可改技能语料且需人工批准),同类项目里少见。
  • 迁移成本低、宿主无关:技能是纯 Markdown,安装只是软链,更新有清单与安全边界,Codex 用户有整套镜像而不是分叉。
  • 适合:适合已有明确研究方向、需要把『文献调研→想法验证→实验部署→多轮修改→成稿』这段长流程搬到夜间或后台推进的 ML/系统/机器人研究者;也适合已经用 Claude Code/Codex CLI 并有远程 GPU 或愿意租 GPU 的个人与小组,想用跨模型对抗审查替代单一模型的自我评价。对想研究『自主 agent 工作流治理』的工程读者同样有价值——仓库把 acceptance gate、reviewer 独立性、外部节奏边界、注入卫生这些原则写成了可读的契约与可执行脚本。
    不适合:不适合:希望开箱即用、不愿意配置多家 API key 与 MCP 服务器的新手(首次跑通需要 Claude Code + Codex 登录 + MCP 注册 + CLAUDE.md 里的 GPU 描述);不愿意让 agent 免确认写文件/跑 shell 的谨慎用户(要么保留 human checkpoint,要么接受手动批准打断夜间流程);完全离线或不允许数据外发到第三方模型厂商的场景(执行器与审查器本身就在外部 API 上);只有一次性小任务、不需要长流程编排的人(82 技能与状态机是为此类长跑付出的复杂度);以及把 AI 评审分数当作投稿保证的人——它优化的是 AI 评审信号,不等于人类审稿人/会议录用。
    安装 agent 直装可复制
    ① 本站镜像 更新 2026-09-15
    方式 A · 人下载镜像包下载 auto-research-in-sleep.tar.gz
    sha256: bbe5d4e4e1f79f79…
    方式 B · JSON 格式安装指南,复制给 agent
    安装指南
    agent 读 JSON 指南后会自动从本站下载安装,无需更多说明。
    ② 上游 GitHub · 原始来源
    能访问 GitHub?直接去上游安装(实时版,可能已更新)GitHub 原始 ↗
    本页镜像锁定 commit 15b9b27de6;上游为实时仓库。
    来源信息 GitHub 原始
    作者 / 仓库wanshuiyin / wanshuiyin/Auto-claude-code-research-in-sleep
    Stars16146
    最近推送2026-09-15
    本 skill commit15b9b27de6
    许可MIT(仓库根 LICENSE,Copyright (c) 2026 wanshuiyin)
    本站信息
    收录日期2026-09-06
    分类基础工具与工作流
    侦查报告AI 侦查 · 2 遍 · 2026-09-06
    本站镜像与 GitHub 原始是不同来源:本站锁定 commit 快照经 /r2 分发;GitHub 为实时上游,内容可能已更新。
    同分类邻近