PaperJury
投稿前让 AI reviewer 先审一遍论文:意见先裁定是否成立,再决定是否修改,模型判断与确定性护栏各司其职。
证据显示明确的人工签核规则('未经明确作者签核绝不修改稿件',auto 仅显式进入)、本地无后端架构、append-only 回滚日志(journal.js revert 经测试覆盖)、MIT 版权与 arXiv/CITATION.bib 溯源充分,故 user_confirmation/rollback/source_attribution 满分。扣分点:scripts/ 下的确定性守卫脚本本身未在证据文件中提供,最小权限、外部副作用和数据流向只能依赖 README 断言,故各扣 1;更新检查对 GitHub 的网络访问默认开启(虽可禁用),敏感数据在云端模型侧的处理超出项目控制范围,故 sensitive_data_handling 与 dependency_security 记 2。
证据显示 node 依赖声明清晰、npm run doctor 健康检查、LaTeX 缺失时诚实降级为 compiled:null,测试覆盖 CRLF/回滚/歧义拒绝等边界,dependency_availability 满分。扣分点:被测脚本源码(apply-patch、compile-guard 等)未在证据中出现,静态审查无法核实实现与文档一致,self_consistency 仅记 2;失败消息只见于测试断言中的正则,实际用户面失败提示未直接可见,记 2。
三种模式触发规则写得非常精确(auto 明确声明绝不自检、仅 /goal 或配置进入),能力边界(不替代同行评审、不可捏造实验)明确声明,trigger_precision 与 capability_boundaries 满分。扣分点:受众实际锁定为使用 Claude Code 的 LaTeX/Markdown 论文作者,跨环境可移植性有限(另有 Codex 移植),audience_and_scenarios 记 2;环境绑定 Claude Code 的 skill/workflow/memory 原语,LaTeX 为可选但整体依赖该宿主,environment_fit 记 2。
文档架构、安装说明(双路径安装+doctor+禁用更新检查的环境变量)、dogfood 样例、FAQ、诚实的局限声明与 MIT 许可均为满分证据。扣分点:无 CHANGELOG 文件,版本沿革仅散见于 News 段(v1.0.0 / v1.2.1 不一致需要读者拼合),versioning_changelog 记 2;命名有 v3 引擎等历史层叠但基本稳定,记 2;维护责任仅由四位列名作者间接体现,无治理/维护承诺声明,maintenance_responsibility 记 1。
输出物(issue ledger、可审补丁、验证报告)定义清晰并附真实 dogfood 样例,成本数据(2.47 小时、6.76M tokens/篇)具体给出。扣分点:可用性与边际价值均基于 README 与论文自报数字,静态审查无法执行验证;与基线对比数字(F1 0.656、ESVR 0.025)未经独立核实,故 output_usability/marginal_value/cost_benefit 各记 2 而非 3。
每条断言可指向 arXiv 论文、dogfood RUN_REPORT 或代码测试;测试明确区分快照回归与行为断言,compile 结果显式区分 compiled:true/null。扣分点:关键脚本源码不在证据内,性能/质量数字无法在本仓库内交叉证实(样例文件未随证据提供内容),故三项均记 2:可追溯但不可在本仓库内独立复核。
- 静态审查未执行任何运行:性能数字(F1、ESVR、成本)均为项目自报,请以 arXiv 论文与 dogfood 样例自行核对后再采信。
- 确定性守卫脚本(scripts/ 下)未包含在本次证据中,安全边界主要依赖 README 描述;使用前建议运行 npm run doctor 并阅读脚本源码。
- auto 模式虽声明仅显式进入,仍请勿在含敏感/未发表稿件的项目中开启广泛工具权限。
- 更新检查默认向 GitHub 发起网络请求;如需完全离线,请设置 PAPERJURY_DISABLE_UPDATE_CHECK=1。
- 无 CHANGELOG 且无维护责任声明,长期维护与安全响应能力不确定。
这个 Agent 能做什么,适合哪些场景?
PaperJury 是 Spark-To-Paper-Skills/paperjury 仓库提供的一个 Claude Code skill,用于论文正式投稿前的自查。它把评审组织成「审稿 → 裁定 → 修改 → 复查」的闭环:N 位领域 reviewer 通读全文,有争议的意见进入 5 人(必要时增至 12 人)陪审团隔离审议,每条问题最终得到 valid-fixable、author-required 或 invalid-drop 三种裁定之一。模型负责阅读、判断和起草;ledger、补丁应用、锚点追踪、编译检查和投稿合规筛查由 scripts/ 目录下的确定性脚本完成。输出包括带证据和状态的问题清单、可审阅的最小补丁和复查报告,仓库还提供 samples/dogfood/ 中修改前后的 PDF 和人工核对过的运行报告。项目文件全部留在本地论文项目内,工具本身没有后端服务器。
以 Claude Code skill 形式运行,安装后通过 SKILL.md 自动发现。工作流为 assign-reviewers → reading-check → coverage-auditor → merge → {trial ‖ polish} → recall-audit → drafter → {edit-audit | meaning-audit} → clerk:根据论文 subfield 分配 2-4 位(默认 3 位)领域 reviewer,各自通读全文并给出弱点、原文引文和置信度;机械性问题走 polish 快速通道,重大争议进入 5/12 人庭审;judge agent 把成立问题路由为 valid-fixable 或 author-required 并设定 close_criterion。确定性脚本包括 decompose(读稿分解)、extract-docx(Word 转 Markdown)、ledger、apply-patch、anchor-diff、cross-ref、compile-guard(真实 LaTeX 编译,无工具链时降级为结构 lint 并报告 compiled:null)、compliance-check(匿名化泄漏、页边距、页数限制等)和 doctor 安装自检。支持 direct-edit、review 和 auto 三种模式,前两种逐处确认补丁,auto 需显式配置 mode: auto 和 /goal。
- 刚写完初稿的研究者:让面板像 reviewer 一样通读全文,把致命缺陷和轻微修改分开。
- 投稿前最后自查的作者:检查 claim 是否过强、实验是否足以支持结论,并执行 submission-readiness 合规检查。
- 只想改一段话的作者:在 direct-edit 模式说「把这段改紧凑但不要改变 claim」,补丁经确认后应用,不会被扩大为整篇重写。
- 需要无人值守多轮修订的作者:显式启用 auto 模式并提供 /goal,安全修改自动应用,高风险项交回作者。
- 写 Word (.docx) 论文的作者:系统一次性转换为 Markdown 工作副本并完整评审,原文件不改,合并回 Word 由你决定。
这个 Agent 有哪些优点和局限?
- 意见先裁定再修改:每条反馈都经过隔离陪审团审议,输出 invalid-drop / valid-fixable / author-required 三种明确裁定,盲审专家对终局裁定一致率 0.887、路由一致率 0.913。
- 确定性护栏控制编辑风险:冻结锚点、单段上限、编辑/含义审计和 recall-audit 把不安全编辑率(ESVR)压到 0.025,为最强 baseline 的约 1/4.4。
- 提供可验证证据:论文 12 篇 held-out 论文 + 四 baseline 评测(arXiv:2606.16322),仓库内置 dogfood 样例(152 条意见 → 55 个问题:26 处安全应用、10 交回作者、19 条驳回),修改后稿件编译 0 error / 0 warning。
- 真实编译与合规检查:在本地运行 LaTeX 编译并报告报错、未定义引用、overfull box 和页数;脚本筛查匿名化泄漏、documentclass 漂移等投稿风险,无法验证时明确说明。
- 绑定 Claude Code 生态:核心运行依赖 Claude Code skill 机制,模型跑在你自己的 session 中,内容处理受该环境条款约束;Codex 用户需转向单独的 paperjury-codex 仓库。
- 有明确的运行成本:论文报告每篇约 2.47 小时、6.76M token,远高于 forward-only 重写器的 0.31 小时,完整庭审深度对快速检查可能过重(quick mode 仍在 Roadmap 中未完成)。
- 明确不能替代 peer review 或作者判断:需要新实验、新证据或研究判断的问题一律交回作者,工具侧不产出结论。
- LaTeX 工具链缺失时功能降级:真实编译和版面检查不可用,只能做结构 lint 且报告 compiled:null。
如何安装或部署这个 Agent?
方式一(Claude Code plugin,推荐):在 Claude Code 中运行 /plugin marketplace add Spark-To-Paper-Skills/paperjury 和 /plugin install paperjury@Spark-To-Paper-Skills。方式二(clone 成 skill):git clone https://github.com/Spark-To-Paper-Skills/paperjury ~/.claude/skills/paperjury(Windows PowerShell 为 $env:USERPROFILE\.claude\skills\paperjury),或放到 <项目>/.claude/skills/ 仅对单个项目生效。前置条件:需要安装 node;LaTeX 工具链可选(缺失时编译检查降级为结构 lint)。安装后在 skill 目录运行 npm run doctor 检查仓库完整性、所需工具和论文文件识别。
如何使用这个 Agent?
安装后在论文项目中直接用自然语言说明需求,无需记忆命令:例如「请审稿,重点检查实验是否足以支持 claim」启动 review 模式;「请把 introduction 这段改得更紧凑,但不要改变 claim」进入 direct-edit;「请执行 submission-readiness / 合规检查」运行格式筛查加编译驱动版面检查。auto 模式必须在配置中设置 mode: auto 并用 /goal 给出可验证目标,缺一都不会启动无人值守多轮循环。深入驱动说明见 docs/AGENT-GUIDE.md。
这个 Agent 与同类方案有什么区别?
论文中以四个 baseline 对比:forward-only 重写器(ESVR 0.240)、LLM 批评器(F1 0.446)、LLM-as-judge 循环(F1 0.519、ESVR 0.110)、朴素无界生成器(8.37 小时/篇);PaperJury 在问题质量(F1 0.656)和编辑安全性(ESVR 0.025)上均优于这些循环式方案。机制上,README 说明其 spine 与防漂移设计受 PaperSpine 启发,但 PaperSpine 偏向 motivation-driven 的起草改写,PaperJury 则专注对抗式评审与庭审式裁定。