WorldX AI 世界生成器
用一句话生成可持续演化、由自主角色驱动的像素世界。
README 清楚列出四类模型角色、对应环境变量、服务端点以及 SQLite 本地持久化,许可证和仓库归属也有明确标示,因此数据流透明度和来源归属获得部分肯定。扣分在于:未说明最小权限或密钥隔离策略;示例直接使用长期 API Key,但没有权限范围、日志脱敏、密钥轮换或泄露处置说明;自主模拟及“上帝模式”没有确认门槛说明;外部模型调用、生成文件和数据库变更缺少完整副作用清单;多时间线并不等同于通用回滚;未提供依赖审计、锁文件或供应链控制证据。未知发布者身份本身未作为风险扣分。
README、项目结构和 package.json 对 Node.js 版本、启动命令、端口及主要组件的描述基本一致,并提供模型供应商和代理故障的处理提示。扣分在于项目明确处于 Alpha,推荐模型包含 preview 标识,依赖安装跨四个子项目执行但未提供这些子项目的清单或锁定证据;失败处理只覆盖少数网络错误,没有展示结构化错误、重试、超时、降级或部分生成失败的用户反馈。
面向的创作场景、内置世界、完整生成、命令行创建、双语支持、四种模型职责和混合供应商配置均说明得较具体,受众与使用路径尤其清晰。扣分在于“任何场景”“任何风格”等能力表述宽泛,除 Alpha 和特定图像模型问题外缺少输入规模、内容边界和不支持能力;触发入口虽明确,但没有说明歧义输入或危险事件注入的约束;环境说明主要覆盖 Node.js、端口和 macOS 的 scutil 代理排障,缺少更完整的操作系统、硬件、数据库和部署兼容矩阵。
README 的快速开始、配置表、平台示例、架构、目录树和开发命令组织良好,安装路径可直接理解;MIT 正文完整且与元数据一致,故这些项目得分较高。扣分在于项目仍为 0.1.0 Alpha,使用若干 preview 模型,稳定性承诺有限;有示例和排障但没有系统 FAQ;已知限制只零散提及;没有 changelog、发布策略、兼容政策或明确维护者,版权仅归于泛称的 WorldX Contributors,交流群和 PRs Welcome 也不能替代维护责任说明。
材料展示了浏览器界面、CLI、内置世界、生成输出目录和可交互的模拟功能,产物具备可消费形态;将地图、角色、记忆、对话和持续演化组合起来也显示出相对于单次内容生成的潜在增量价值。扣分在于关键效果主要由 README 宣称和截图支持,未提供可检查的输出样例内容、质量指标或比较结果;完整流程需要四类模型且模拟会高频调用,虽然提到免费额度和便宜模型,却没有费用、延迟、资源消耗或收益估算。
README 的命令、端口、包版本和许可证可分别与 package.json、LICENSE 相互印证,形成有限的跨文件佐证。扣分在于未提供实现代码、测试、样例生成记录或声明到具体源码位置的映射,大多数自主行为和生成质量主张无法由所给文件追踪;模型推荐和质量比较也没有方法或数据,营销性事实、经验判断与已验证结论的区分不足。
- 完整生成需要向最多四个外部模型角色发送提示词或生成内容;在确认各供应商的保留、训练和地域政策前,不要输入机密数据。
- 将真实密钥仅存放在未提交的本地 .env 中,并检查日志、生成文件和版本控制状态;材料没有证明密钥脱敏、最小权限或轮换机制。
- 根级 postinstall 会继续在四个子目录执行 npm install;在锁文件和依赖审计证据缺失的情况下,应先审查各子包及安装脚本。
- 项目明确为 Alpha,且示例依赖 preview 模型;应预期模型下线、输出格式变化、生成失败及成本波动,并在重要世界数据上保留独立备份。
- 时间线功能不能视为数据库、配置或生成资产的完整撤销机制;执行批量生成或记忆编辑前应自行备份 output/worlds 和 SQLite 数据。
这个 Agent 能做什么,适合哪些场景?
WorldX 是一个处于 Alpha 阶段的自托管 AI 世界生成与多角色模拟项目。用户通过网页或命令行输入场景描述,编排管线据此设计世界结构、角色和规则,生成地图美术与角色立绘,并把结果保存为可运行的世界。服务器以 Express、SQLite 和大模型驱动角色决策、对话、记忆、关系及跨昼夜演化,每条时间线分别持久化。客户端由 Phaser 3 与 React 19 构成,以像素游戏界面呈现世界,并提供事件广播、角色人格或记忆编辑以及架空对话等干预方式。它适合愿意自行配置多组模型、承担生成 API 成本并接受早期项目稳定性的创作者、研究者和原型开发者。
端到端流程从 orchestrator/src/index.mjs 开始,把一句自然语言描述交给 world-designer.mjs 和 config-generator.mjs,产出世界结构、角色与规则配置。generators/map 通过多步骤生成和审查循环制作地图,generators/character 生成角色立绘并执行抠图。server/src 中的 WorldManager、CharacterManager、SimulationEngine、DecisionMaker、DialogueGenerator、LLMClient 和 PromptBuilder 负责加载世界、调用所配置的大模型、生成角色行为与对话,并将各时间线写入 SQLite。client/src 使用 BootScene、WorldScene、React 覆盖层以及相机、寻路和回放系统呈现模拟。生成内容存入 output/worlds,项目也可从 library/worlds 加载两个内置示例世界;用户可通过网页创建世界,也可运行 npm run create -- "场景描述"。
- 独立游戏开发者需要快速验证一个由自主 NPC、关系和对话驱动的像素世界原型。
- 交互叙事作者希望从一句场景设定出发,观察没有预写剧本的故事如何自然涌现。
- 多 Agent 研究者需要一个包含角色决策、记忆、人格、时间线和持久化的可运行实验环境。
- 创意团队希望自动生成地图与角色美术,再通过事件广播或编辑角色记忆测试不同剧情走向。
- 教学者或演示者需要用可视化世界展示大模型驱动的角色模拟、昼夜演化和人机干预。
这个 Agent 有哪些优点和局限?
- 从一句话贯通世界设计、地图与立绘生成、运行时模拟和像素客户端展示,而非只生成静态设定文本。
- 角色具备决策、对话、关系、记忆和人格机制,并支持昼夜循环与多个独立时间线。
- 上帝模式允许广播事件、修改人格或记忆并开展架空对话,便于进行可控的叙事实验。
- 四类模型角色可分别选择服务商;除 Google 原生图片接口外,其余均使用 OpenAI 兼容的 chat/completions 协议。
- Express、SQLite、Phaser 3、React 19 和 TypeScript 组成完整的本地运行边界,并提供网页与 CLI 两种创建入口。
- 项目明确处于 Alpha 阶段,虽然核心可用,但仍在持续优化,生产稳定性没有得到证明。
- 完整生成必须配置编排、绘图、视觉审查和世界驱动四类模型,带来多组凭据、调用费用和故障排查成本。
- 地图与角色美术依赖外部生成模型,README 特别指出不同图像模型的指令遵循会影响最终效果。
- 运行时需要网络访问模型服务;代理、地区限制、ETIMEDOUT 和 Node.js 未继承浏览器代理都是已记录的失败模式。
- 需要 Node.js 18+、本地文件读写和 SQLite 持久化;来源未提供容器化部署、托管服务或规模化运行说明。
如何安装或部署这个 Agent?
前置条件是 Node.js 18+,并准备模型服务的 API Key。执行:
git clone https://github.com/YGYOOO/WorldX.git
cd WorldX
cp .env.example .env
npm install
npm run dev若只体验两个内置世界,在 .env 中配置 SIMULATION_BASE_URL、SIMULATION_API_KEY 和 SIMULATION_MODEL 即可。完整创建世界需要配置 ORCHESTRATOR_、IMAGE_GEN_、VISION_ 和 SIMULATION_ 四组模型参数;绘图还可设置 IMAGE_GEN_PROVIDER=openai-compatible 或 google-native。开发服务器启动后,客户端位于 http://localhost:3200,服务器位于 http://localhost:3100。
如何使用这个 Agent?
快速体验时打开 http://localhost:3200,选择内置世界并点击播放。完整创建时配置全部四组模型,打开 http://localhost:3200/create,输入一句世界描述。也可执行:
npm run create -- "赛博朋克风格的深夜拉面馆,黑客和仿生人在这里交换情报"
创建后可观察角色自主决策、互动和对话,并通过上帝模式广播事件、编辑角色人格或记忆、与任意角色进行架空对话。若浏览器能访问模型服务而 Node.js 出现 fetch failed、ETIMEDOUT 或区域限制错误,需要让 Node.js 走 TUN、透明代理,或在启动前设置 HTTP_PROXY、HTTPS_PROXY 和 ALL_PROXY。
这个 Agent 与同类方案有什么区别?
模型接入可在 OpenRouter、Google AI Studio或混合配置之间选择。OpenRouter 可用一个 Key 覆盖四类模型;Google AI Studio 提供 OpenAI 兼容端点,并为绘图支持 google-native;混合方式则允许世界设计、美术、视觉审查和高频模拟分别使用不同平台,例如用 DeepSeek 驱动模拟。