LLM Agents Papers
按能力与应用场景整理大语言模型智能体必读论文。
- 该仓库从现有证据看是文献清单,而不是可安装或可运行的 Agent 产品或框架;不要将此评估解释为对其中所列论文或系统的安全性与质量评价。
- README 中的 MIT 徽章不足以确认实际许可条款;在取得许可证正文前,应将复用和再分发权限视为未确认。
- 论文链接、作者、日期和分类仅按所给静态文本记录,未经执行、外部检索或独立核验。
这个 Agent 能做什么,适合哪些场景?
LLM Agents Papers 是一个面向大语言模型智能体研究的论文与资源清单,并非可安装或运行的智能体软件。仓库将论文分为综述、单智能体、多智能体、应用、框架及其他主题;单智能体部分进一步涵盖人格、记忆、规划、工具使用和强化学习训练。多智能体条目按协作、对抗以及开放式对话等交互方式组织。资源部分还收录 Mind2Web、AgentBench、TravelPlanner、OSWorld 和 AppWorld 等基准。各条目通常提供论文标题、作者、链接与日期,部分条目附带代码仓库链接;其交付边界是静态研究索引,不包含模型运行时、API、命令行工具或部署服务。
该仓库通过 README 维护人工编排的研究目录:读者从 Content 导航进入 Overview、Agent、Multiple Agents、Application、Framework、Others 和 Resources 等章节,再按 Personality、Memory、Planning、Tool use、RL training、Collaborative Exchanges、Adversarial Interactions、Casual/Open Conversations 或 Benchmarks 等子主题查找资料。每项记录指向论文摘要页或 PDF,并列出作者和发表时间;部分记录另附 code 链接。仓库本身不执行论文检索、模型调用、智能体规划、评测或数据处理,也没有给出可调用的 API、类、命令或自动生成输出的流程。
- 刚进入 LLM 智能体领域的研究者,可按综述、记忆、规划和工具使用等主题建立阅读路径。
- 准备多智能体课题的学生,可分别查找协作通信、辩论式交互和社会模拟相关论文。
- 设计智能体评测的工程师,可从 Benchmarks 部分定位 AgentBench、OSWorld、TravelPlanner、AppWorld 等测试资源。
- 撰写文献综述的作者,可借助按主题和日期排列的标题、作者及论文链接形成候选文献集。
- 调研智能体框架或应用方向的团队,可分别浏览 Framework 与 Application 条目,并跟进部分论文附带的代码链接。
这个 Agent 有哪些优点和局限?
- 分类跨度较完整,同时覆盖单智能体的人格、记忆、规划、工具使用和强化学习训练,以及多智能体交互。
- 条目通常同时给出标题、作者、论文链接和日期,便于快速核对并继续阅读原文。
- 除论文外还单列应用、框架和基准资源,并为部分项目提供代码链接。
- 材料时间范围从早期工作延伸到来源中标注的 2026 年论文,能够呈现研究主题的演进。
- 它是静态清单而非可执行智能体,不提供检索 API、命令行界面、模型调用或自动化工作流。
- 来源没有说明条目遴选标准、系统检索方法、同行评审状态核验或覆盖完整性,不能直接视为系统性综述。
- README 存在编号重复、编号跳跃及日期格式不一致,引用前需要人工复核。
- 仓库元数据把许可证标为 unknown,而 README 展示 MIT 徽章;来源未提供许可证文件内容,采用前应进一步核实授权范围。
- 没有文档化的安装、导出、引用管理或与 ChatGPT、Codex、Claude 及其 API 的集成路径。
如何安装或部署这个 Agent?
无需安装:现有材料只描述了一个 GitHub 论文清单,没有软件包、依赖文件、构建命令、容器镜像、服务端点或运行时要求。若希望离线保存仓库,通常可以克隆 GitHub 仓库,但来源未提供或验证具体安装命令,因此这里不把克隆操作描述为产品安装。
如何使用这个 Agent?
打开仓库 URL,使用 README 的 Content 目录进入所需研究主题,然后通过各条目的 abs、paper 或 code 链接访问论文或相关代码。首次使用不需要凭据,也没有配置文件或启动命令。来源未说明自动搜索、筛选、导出、引用管理或定期同步接口;需要这些能力时,使用者必须自行编写集成或手工整理。
这个 Agent 与同类方案有什么区别?
仓库明确推荐两个同组织的相邻清单:Prompt4ReasoningPapers 聚焦语言模型提示推理,KnowledgeEditingPapers 聚焦大语言模型知识编辑;LLM Agents Papers 的范围则集中在智能体能力、多智能体交互、应用、框架和评测资源。