新闻宏观经济吴恩达发布 OpenWorker:一款开源的、本地优先的桌面 AI 协作助手

吴恩达发布 OpenWorker:一款开源的、本地优先的桌面 AI 协作助手

作者: MarkTechPost·

要点速览

  • OpenWorker 是一款由吴恩达创建的采用 MIT 许可证的开源桌面代理,它产生的是最终交付成果,而不是聊天回复。
  • 该系统完全在用户的机器上运行,采用四层架构,包括 Tauri 2 桌面外壳、本地 Python FastAPI 代理服务器、能力与连接器层以及模型路由器。
  • 用户必须提供自己的 API 密钥或本地运行时,才能访问来自 OpenAI、Anthropic、Google 和 Ollama 等提供商的 30 个精选模型。
  • 类型化的风险引擎将每个工具调用分配到四个风险类别之一——read、write_local、exec 或 external,并在五种权限模式下管理执行过程。
  • 本地优先的隐私模型将对话、连接器令牌和模型密钥保留在用户的设备上,可选的云代理仅用于 OAuth 握手。
吴恩达发布 OpenWorker:一款开源的、本地优先的桌面 AI 协作助手

吴恩达宣布推出 OpenWorker,这是一款开源桌面代理,旨在产生最终工作成果,而不是基于聊天的回复。吴恩达是 DeepLearning.AI 的创始人,曾领导 Google Brain 和百度的 AI 研究工作,并且是 Coursera 的联合创始人。该公告已在 X 上分享:https://x.com/AndrewYNg/status/2080333504446108104。

OpenWorker 是围绕“成果”而非“提示词”构建的。用户可以要求完成一份润色好的文档、一条包含实际数字的 Slack 回复、一个更新后的日历或一个分类好的收件箱。然后,系统会将请求的目标分解为多个步骤,跨本地文件和连接的应用程序进行操作,并在采取重要行动之前与用户进行确认。这使得 OpenWorker 属于新兴的代理式 AI 工具类别,这类工具可以跨应用程序完成多步骤任务,而不仅仅是生成文本回复。

在本地机器上运行的四层架构

OpenWorker 的架构分为四层,所有层均在用户的机器上运行。该代码库包含 119 个 Python 文件(总计约 32,400 行代码),位于 coworker/ 目录下;149 个 TypeScript/TSX 文件,位于 surfaces/gui/ 目录下;以及 78 个后端测试模块。

桌面外壳是一个 Tauri 2 原生窗口,封装了 React 18 用户界面。Tauri 是一个开源框架,用于使用 Web 前端和原生系统访问权限来构建轻量级桌面应用程序。它的包标识符为 com.openworker.desktop,外壳本身负责管理 Python 服务器。

本地代理服务器使用基于 FastAPI 和 uvicorn 的 Python 3.10+ 版本。默认情况下,它绑定到 127.0.0.1:8765。示例配置将单轮对话限制为 12 次模型工具迭代。

能力和连接器层包括经过审查的本地工具,用于文件、git、基于 ripgrep 的搜索、shell 访问和待办事项管理,以及托管集成和 MCP(模型上下文协议): 是 Anthropic 于 2024 年底推出的一项开放标准,旨在通过通用协议将 AI 助手连接到外部数据源和工具。

模型路由器在原生、OpenAI 兼容、经销商和本地提供商之间提供了一个统一的接口。该引擎建立在 aisuite 之上,这是吴恩达开发的与提供商无关的 LLM 库:https://github.com/andrewyng/aisuite。aisuite 提供了一个统一的接口来调用来自多个提供商的模型,而无需更改应用程序代码。

自带模型访问

OpenWorker 不提供自己的推理服务。用户可以将 API 密钥粘贴到应用程序中,或者将其指向本地运行时,这意味着用户直接向提供商付费,并保留对哪些模型处理其数据的控制权。

精选的模型矩阵正好包含 30 个条目。原生提供商包括 OpenAI(包含 GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna 和 GPT-5.5);Anthropic(包含 Claude Fable 5、Opus 4.8、Sonnet 4.6 和 Haiku 4.5);以及 Google(包含 Gemini 3.1 Pro、3.6 Flash、2.5 Pro 和 2.5 Flash)。

OpenAI 兼容的供应商增加了 GLM-5.2、DeepSeek V4、Kimi K2.6、MiniMax M2.5、Qwen3 Max、Grok 4.3 和 Mistral Large。开放权重模型可通过 Together AI( Fireworks( Ollama( API 密钥。

权限系统和风险类别

OpenWorker 将批准视为一个类型化的层,而不仅仅是用户界面的一项功能。每个工具调用都被划分为四个风险类别之一:read(无副作用的操作);write_local(对工作区的路径范围更改);exec(运行命令);以及 external(在机器外部产生副作用的操作)。

五种权限模式决定了如何处理这些操作。discussplan 是只读模式。interactive 是默认模式,在执行写入、命令和外部操作之前请求批准。auto 允许所有操作,同时保持路径范围限制。custom 自动批准用户定义的工具列表。

两个设计选择定义了该批准模型。首先,无人值守模式并不会提高自主权限级别;它只会更改联系用户的位置。通常会内联显示的提示会被路由到收件箱,并且会话将暂停,直到用户做出回应。

其次,任务范围的常设规则仅限于外部风险。根据设计,Shell 命令继续需要批准。

内置的运维角色(ops persona)还指示模型将来自工具、日志、网络、文件和传入消息的内容视为不受信任的数据,而不是指令。这种提示词注入防御机制被写入了发布的角色设定中。将外部内容视为不受信任的数据是防御间接提示词注入的一种措施,这种攻击向量试图通过嵌入在数据源中的恶意指令来操纵代理的行为。

本地优先的隐私模型

模型调用直接从用户的机器发送到配置的提供商。对话、连接器令牌和模型密钥保留在本地。密钥存储的设计确保了密钥不会进入模型的上下文、提示词或追踪记录中。

唯一的云组件是一个可选的代理,用于处理一键连接器使用的 OAuth 握手。它使用带有 PKCE 的 Auth0 授权码。连接器令牌直接交到用户的机器上,不存储在云端。通过使用手动粘贴的凭据,该应用程序在未登录状态下也能保持全部功能。

OpenWorker 采用 MIT 许可证,定位为一款桌面 AI 协作助手,它返回的是完成的交付成果,而不是聊天回复。它的技术栈结合了 Tauri 2 和 React 外壳,以及建立在 aisuite 之上的本地 Python FastAPI 代理服务器。模型访问采用自带密钥(BYOK)的方式,支持 30 个精选的工具调用模型,并可通过 Ollama 获得完全本地的访问权限。一个类型化的风险引擎使用 readwrite_localexecexternal,在五种权限模式下对操作进行控制。

OpenWorker 的 GitHub 代码库可在 https://github.com/andrewyng/openworker 获取,项目网站为