开发与工程 arxivpaper-implementationcitation-anchoringcode-generationreproducibilitymachine-learning

paper2code:论文转代码技能

将任意 arXiv 论文转化为带引用锚定的可运行实现

FollowAgents 评估 · FARS-2.1
不推荐
36/ 100 五分制 1.8 / 5
1 2 3 4 5 6
1信任安全0 / 29 · 0.0/5

证据:仓库仅包含README和LICENSE,无代码或可执行文件,因此没有权限请求、数据流或外部影响。扣分:由于没有实际实现,无法评估最小权限、用户确认、数据流透明度、敏感数据处理、依赖安全、外部影响、回滚和来源归属;这些标准均得0分。

2可靠稳定6 / 14 · 2.1/5

证据:README内部一致,描述了清晰的工作流程和设计原则。扣分:没有实际代码或测试,依赖可用性仅基于README中提到的npx和Python包,未验证;失败消息未描述,因此得1分。

3适用触发10 / 18 · 2.8/5

证据:README明确了目标受众(ML从业者)和多种使用场景(不同模式、框架)。扣分:能力边界有说明(不会做什么),但环境适配仅提到Claude Code,未覆盖其他代理;触发精度有示例但未验证。

4规范维护9 / 18 · 2.5/5

证据:信息架构清晰,安装说明存在,示例和FAQ部分有,已知限制明确,许可证为MIT。扣分:命名稳定性未提及,版本控制/变更日志缺失,维护责任仅由贡献指南暗示,未明确。

5有效结果7 / 13 · 2.7/5

证据:输出可用性描述详细(生成的文件结构),边际价值明确(解决论文实现中的模糊性)。扣分:成本效益未量化,没有实际运行证据,因此得1分。

6证据核验4 / 8 · 2.5/5

证据:声明可追溯性通过引用锚定机制体现,事实与推断分离通过UNSPECIFIED标签体现。扣分:跨来源佐证仅提到官方代码,未提供实际验证,因此得1分。

证据充分度: 评估于 2026年8月9日 审查版本 fcffce7a1250
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 仓库仅包含README和LICENSE,没有实际代码或测试,无法验证功能。
  • 安装命令依赖npx skills add,可能涉及外部服务,需谨慎。
  • 生成代码的准确性和安全性未经验证,使用前应审查。
评估证据 [1][2]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

paper2code 是一个针对 Claude Code 的 Agent 技能,输入 arXiv 论文 URL,输出一个结构化的代码项目,其中每行关键代码都标注了对应的论文章节和公式。它通过歧义审计将实现选择分类为 SPECIFIED、PARTIALLY_SPECIFIED 或 UNSPECIFIED,并在代码中明确标记未指定的部分,避免模型静默填补空白。该技能会生成包含模型、损失、训练、数据、评估等模块的 src 目录,以及超参数配置文件和教学 Notebook。它强调诚实的不确定性,并包含附录挖掘功能,将附录、脚注和图注作为一等信息来源。

paper2code 通过命令 /paper2code <arxiv_url> 触发,可接受完整 URL 或裸 arXiv ID。它首先获取论文文本,进行解析和歧义审计,然后生成代码项目:包含 README.md、REPRODUCTION_NOTES.md(歧义审计结果)、requirements.txt、src/ 下的 model.py、loss.py、train.py、data.py、evaluate.py、utils.py、configs/base.yaml 以及 notebooks/walkthrough.ipynb。每个代码文件中的非平凡决策都用 §X.Y§X.Y, Eq. N 注释锚定到论文章节,未指定的选择用 [UNSPECIFIED] 注释标记,并附带常见替代方案。skill 还支持 --framework--mode full--mode educational 等参数。

  1. 研究人员希望快速理解一篇论文的实现细节,而不是从头阅读冗长的代码库。
  2. 机器学习工程师需要验证一篇论文的可复现性,并查看哪些超参数是论文明确指定的。
  3. 学生想要通过一个可运行的 Notebook 来学习论文的每个组件如何对应到代码。
  4. 开发者需要为特定框架(如 JAX)生成论文实现。
  5. 论文作者希望检查自己的论文是否存在歧义,以便改进描述。

这个 Agent 有哪些优点和局限?

优点
  • 引用锚定:每行代码都带有论文章节引用,便于验证。
  • 歧义审计:明确标注未指定和部分指定的实现选择,避免幻觉。
  • 诚实不确定性:[UNSPECIFIED] 注释列出常见替代方案。
  • 附录挖掘:将附录、脚注和图注作为一等信息来源。
  • 包含教学 Notebook,便于学习和验证。
局限
  • 仅支持 Claude Code,平台绑定。
  • 不保证实现正确性,如果论文本身有误,代码也会出错。
  • 不实现基线或标准组件,需要外部依赖。
  • 不下载数据集,提供的是骨架而非完整数据管道。
  • 不提供训练基础设施,如分布式训练等。

如何安装或部署这个 Agent?

使用 npx 命令安装:npx skills add PrathamLearnsToCode/paper2code/skills/paper2code。安装过程中会提示选择代理(如 Claude Code)、范围(全局或项目级)和方法(符号链接或复制)。

如何使用这个 Agent?

安装后,启动 Claude Code,然后运行 skill 命令,例如:/paper2code https://arxiv.org/abs/1706.03762。也可以指定框架(--framework jax)、模式(--mode full--mode educational),或直接使用裸 arXiv ID(/paper2code 1706.03762)。

常见问题

这个技能能保证生成的代码是正确可运行的吗?
不能。它匹配论文的描述,如果论文本身模糊或错误,代码也会有问题。但它会明确标记未指定部分,让你知道哪里需要自己决定。
它支持多个代理吗?
目前主要支持 Claude Code。安装时可以选择代理,但文档主要针对 Claude Code。
如果需要数据集怎么办?
该技能不会下载数据集,但会生成 data.py 骨架,包含预处理 TODO 和下载指引。
它是否实现了论文的所有内容?
它只实现论文的核心贡献,不实现基线和标准组件(如标准 transformer 编码器)。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents