手机端的 AI Agent 产品看了一圈会发现一个共同点:无论是腾讯元宝、字节豆包、阿里千问,还是海外的 ChatGPT、Claude 官方 App,主流消费级产品几乎都不允许用户填入自定义的模型 API。而桌面端的 Chatbox、Cline、Continue 一类工具却经常支持。这份调研试着回答:这是技术做不到,还是有更深层的结构性原因。
先纠正一个前提:并非“都不给填”#
“不给填自定义 API”的主体主要是大厂 C 端消费级产品。而开发者、极客向的开源工具里,很多产品恰恰支持 BYOK(Bring Your Own Key),例如 Chatbox、Cherry Studio,以及 Open-AutoGLM 一类开源方案。
所以真正的问题应该拆成两个:
- 为什么大厂 C 端 Agent 很少开放 BYOK?
- 为什么手机端 Agent 比普通聊天客户端更难做成任意模型可插拔?
1. 产品定位与商业模式的根本分歧:卖“产品”还是卖“能力”#
这是最底层的原因。国内大厂普遍把“消费级 App”和“开放平台”分开:
- 腾讯:元宝承担消费级产品体验,开放模型能力主要由腾讯云混元等平台承载;
- 字节:豆包是消费端,模型 API 与企业能力主要放在火山引擎方舟;
- 阿里同理:千问 App 面向普通用户,开放能力由百炼 / DashScope 等平台提供。
也就是说,这些 App 卖的是打包好的体验:模型、账号、产品能力、内容安全和计费关系被放在同一个闭环里,而不是把自己定位成通用模型容器。
如果允许用户随意换成第三方 API,平台就要重新面对计费关系、数据流向、模型兼容、质量控制和客服责任。对一个以“开箱即用”为目标的 C 端产品来说,BYOK 并不是多一个设置项那么简单。
国际端也是类似逻辑。ChatGPT、Claude 等消费者 App 的核心商业关系是由产品方托管推理能力;而 BYOK 更常见于开发者工具、自托管工具和聚合客户端,因为这些产品本来就把“模型选择权”当作能力的一部分。
2. 安全与合规:开放自定义 API 会扩大责任边界#
2.1 先区分两种完全不同的 Key#
把厂商自己的服务凭据硬编码进 APK,当然是明确的安全错误。移动端二进制可以被分析和反编译,长期服务密钥不应该直接藏在客户端里。
但用户自己的 BYOK Key 不是同一个问题。如果架构允许客户端直连模型服务,用户 Key 可以保存在 iOS Keychain、Android Keystore 等系统安全存储中,而不必然经过产品服务器;如果产品选择由服务器代用户调用模型,则又需要服务端密钥加密、权限隔离、日志脱敏、吊销和用量归因。
换句话说,BYOK 不是“手机端一定不能安全保存 Key”,而是它会让产品新增一整套凭据生命周期与责任边界。对于面向大众的 App,这笔复杂度未必值得承担。
2.2 中国监管环境正在要求更清楚的权限和责任边界#
2026 年 5 月,国家网信办等部门发布《智能体规范应用与创新发展实施意见》,明确提出智能体需要做好权限管理、行为管控、全生命周期安全管理,并强调用户授权边界和高风险操作控制。
同年 7 月 15 日,《人工智能拟人化互动服务管理暂行办法》开始施行。需要特别说明的是:这部办法针对的是持续性的拟人化情感互动服务,文件明确写明,不涉及持续性情感互动的工作助手、知识问答等服务并不适用。因此,不能简单把它概括成“所有手机 Agent 都要按这部办法备案”。
2026 年 7 月前后,豆包、千问、腾讯元宝等产品也陆续调整或下线过部分用户自建智能体能力。这个时间点与监管政策密集落地重合,但厂商公开解释多为产品调整或功能维护,目前没有足够公开证据把两者写成已经确认的直接因果关系。
更稳妥的判断是:监管并不是大厂不做 BYOK 的单一原因,但它会提高平台对权限、模型来源、调用链和高风险行为可追溯性的要求。允许任意第三方模型接入后,这些责任边界会更复杂。
2.3 行为安全:模型 Key 不应该等于设备操作权限#
Agent 会主动操作手机:点击、滑动、输入,甚至可能触达支付、账号和隐私数据。这里真正危险的不是“用了第三方模型 Key”本身,而是模型调用身份和设备行为权限如果被混成同一套凭据。
更合理的架构通常会把两件事拆开:模型 API Key 只负责模型调用;设备动作、账号资源和高风险操作通过用户身份、OAuth / scoped token、系统权限和二次确认单独控制。第三方模型可以参与规划,但不能因为拿到一个模型 Key 就天然获得设备权限。
所以手机 Agent 开放 BYOK 后,产品还必须回答一个额外问题:第三方模型可以提出什么动作,谁有权真正执行这些动作?
3. 技术强绑定:手机 Agent 不等于通用聊天接口#
这是“手机端 Agent”比普通聊天 App 更难开放任意自定义 API 的特有原因。
手机 Agent 往往是“屏幕感知 → 意图解析 → 动作规划 → 执行 → 验证”的闭环。它需要模型理解截图、稳定输出动作协议、处理坐标或 UI 语义,并在失败后继续规划。普通聊天模型即使能看图,也不代表它天然符合这套动作合同。
因此,“Base URL + Model + Key”只解决了怎么请求模型,并没有解决这个模型是否具备 Agent 运行时需要的能力。一个真正可插拔的手机 Agent 还需要至少定义:
- 视觉输入和截图协议;
- tool / action schema;
- 模型能力声明与兼容检测;
- 错误恢复和动作校验;
- 不同模型接口格式与流式行为的适配。
开源或开发者工具可以把一部分兼容成本交给使用者承担;面向普通用户的大厂 App 却要把“填错模型、动作失败、结果不一致”的体验成本接回来。
所以这里不是“想开也开不了”,而是:能开,但要为开放付出持续的兼容和产品成本。
4. 体验一致性与补贴模式的考量#
- SLA 与体验一致性:自有模型可以围绕延迟、动作成功率、安全策略做联调;第三方 API 的质量和能力差异更大,最终差评仍会落在 App 本身。
- 商业关系:消费级 App 的订阅、免费额度、活动补贴通常和自有推理成本绑定。BYOK 会把一部分高价值用户从原本的计费闭环中移出去。
- 客服成本:一旦支持任意 Base URL / Model,网络、限流、模型能力、接口兼容都会变成产品客服需要解释的问题。
5. 反例与趋势:什么时候更容易开放自定义 API#
一旦产品定位从“消费级服务”转向“开放工具”,自定义 API 就更自然:
| 产品类型 | 代表 | 自定义 API / Key |
|---|---|---|
| 大厂 C 端 Agent | 豆包 / 元宝 / 千问 / ChatGPT / Claude App | 通常封闭 |
| 开放云平台 | 火山方舟 / 混元 / 百炼 / OpenAI Platform | 本身就是 API |
| 开源 / 开发者工具 | Chatbox、Cherry Studio、Open-AutoGLM | 常见 BYOK / Base URL / Model |
| 桌面开发者工具 | Cline、Continue、LibreChat 等 | 常见 BYOK |
所以 BYOK 并不是一种“先进产品必然会有”的功能,而是产品定位的结果。开发者工具把模型选择权当卖点;消费级产品更看重稳定、统一和责任闭环,两边优化的是完全不同的东西。
6. 结论#
一句话概括:大厂手机 Agent 很少开放自定义 API,不是单纯“技术做不到”,而是产品定位、商业关系、安全责任、兼容成本和手机 Agent 的动作能力合同共同作用的结果。
- 大厂倾向把消费级 App 与开放 API 平台分开经营;
- BYOK 会新增凭据管理、模型兼容、客服和行为权限边界;
- 中国对智能体权限与安全责任的治理要求正在变得更明确,但不能把某一部法规简单解释成“所有手机 Agent 禁止第三方 API”;
- 手机 Agent 需要的不只是聊天接口,而是一套视觉、动作、验证和权限合同;
- 对开发者工具来说,这些复杂度可以换来开放性;对大众 App 来说,它未必是一笔划算的交易。
主要来源#
- 《智能体规范应用与创新发展实施意见》(中国网信网)
- 《人工智能拟人化互动服务管理暂行办法》(中国网信网)
- 《人工智能拟人化互动服务管理暂行办法》答记者问(中国网信网)
- 三大平台接连关停智能体,开发者自己搭 Agent 的路怎么走?(SegmentFault)
- What is BYOK (Bring Your Own Key) AI, and why does it matter?(Calmara)
- Best Practices for Secure Access of Third-Party APIs from Mobile Apps(Approov)
- Open-AutoGLM(GitHub)
- Chatbox AI / Cherry Studio
可信度说明:监管与适用范围以中国网信网官方文件为主;产品下线原因的公开信息仍不足以证明单一因果;第三方文章与社区资料只用于补充产品与工程侧观察。
免责声明: 本文为客座作者 t-zt 的个人观点与调研记录,不代表 Tomz.io、Tomz 或 Mira 的立场。文中事实、产品能力与政策环境可能随时间变化;如有错误或新的公开证据,欢迎通过 GitHub Issue / Pull Request 指正。