Google 当前定价页列出的 Gemini 3.5 Flash 标准费率为:输入每百万 token $1.50,输出每百万 token $9.00;这只覆盖模型调用,不代表完整部署成本,具体费率以官方 Gemini API 定价页为准。
症状:只按模型单价做预算,上线后仍说不清总成本。
最快解法:分别核算模型输入与输出、屏幕状态回传、执行环境、失败重试、人工确认和隔离维护;浏览器任务先评估轻量隔离环境,只有要测 macOS 原生应用或系统交互时,才评估云端 Mac。
准备把 Gemini 3.5 Flash Computer Use 从原型推进到持续运行的开发者,适合从这里拆解预算项目。
负责 QA 或平台预算的工程师,可据此把重试、人工复核和环境维护纳入估算。
需要覆盖 macOS 原生应用的团队,可重点看 Mac 环境的适用条件。
先按任务目标选运行环境
Gemini Computer Use 并不是一台由模型接口托管、可直接接管的完整桌面。模型返回界面动作后,你仍要部署客户端来接收动作、在目标环境中执行,再把新的屏幕状态传回模型;Google 的Computer Use 实现文档说明,这种交互需要应用端实现持续动作循环,并准备执行环境。
浏览器任务一定要准备完整桌面吗? 通常不需要。若工作只涉及网页点击、表单填写和页面检查,可以先用浏览器自动化和隔离配置验证;若要测 macOS 原生应用、Safari 的目标行为或系统级交互,才需确认真实 Mac 环境是否不可替代。浏览器里能打开一个网站,不等于验证了原生应用或系统权限。
| 任务目标 | 可先评估的环境 | 主要成本与维护项 | 转换环境的条件 |
|---|---|---|---|
| 网页表单、站点回归 | 浏览器自动化、隔离浏览器配置 | 浏览器启动与清理、会话状态、截图回传、并发资源 | 目标行为依赖 Safari 特性或系统交互时,评估 Mac |
| 桌面应用界面操作 | 隔离的桌面虚拟机或专用设备 | 图形会话、应用安装、分辨率与状态复位、权限管理 | 应用只支持 macOS 时,评估 Mac 执行环境 |
| 手机界面流程 | 与目标设备匹配的移动端环境 | 设备状态、应用版本、账号与测试数据隔离 | 需要验证真实设备行为时,不以浏览器环境代替 |
| macOS 原生应用或系统权限 | macOS 执行环境 | 系统授权、应用版本、账号安全、镜像与重置运维 | 先核实任务是否确实离不开 macOS |
容器适合隔离浏览器进程,但不会自动成为完整桌面或 macOS;虚拟机适合需要桌面会话的任务,却增加系统镜像、更新和清理责任。云端 Mac 只有在目标应用或系统能力要求 macOS 时,才应加入成本比较。Google 的实现说明建议在沙箱虚拟机、容器或权限受限的浏览器配置中运行 Agent,并由客户端执行动作。
按模型调用和屏幕循环核算费用
一次任务可能包含多轮 API 请求:模型读取屏幕并给出动作,客户端执行,再采集新画面并请求下一步。任务数量相同,不代表 token 用量相同;页面变化频率、观察次数、输出动作和上下文回传量,都会影响总调用量。
Gemini API 的模型费用取决于实际输入与输出 token;图像会计入输入,思考 token 等用量也应结合响应中的 usage 信息核对。开始估算前,可用官方 token 统计说明了解如何观察调用用量,避免把每个任务假设成固定请求次数。
截图成本也不能简单按“截图张数”估算。发送的图像数量、图像分辨率、历史上下文是否重复传入,以及多轮循环中累计回传的屏幕状态,都会影响 token 总量。Google 的图像理解文档说明,图像分辨率设置会影响图像 token 分配;因此,应在真实任务中比较不同截图细节设置的 usage,而不是先假设某种设置一定更省钱。
按标准费率,模型费用可先用这个公式估算:
模型费用 ≈ 输入 token 总量 ÷ 1,000,000 × 输入单价 + 输出 token 总量 ÷ 1,000,000 × 输出单价
按每轮累计输入与输出,不要只算第一次请求。实际模型版本、计费档位和调用方式可能影响费率;批处理、优先级或缓存等选项应分别核价,不能直接套用标准费率。本文引用的 Gemini 3.5 Flash 标准价格核对于 2026 年 10 月 1 日,正式部署前仍应重新查看定价页。
截图与动作重试会怎样影响预算? 如果一次失败后需要重新截图、回传历史上下文,再让模型生成纠正动作,新增输入和输出都会计入用量。建议把首次尝试和失败后的追加调用分开记录;人工复核不属于 API 费用,但其投入时间仍是项目成本。
把执行、失败和人工复核拆开记账
网页变化、弹窗、登录过期或会话中断,都可能让 Agent 停止、重试或需要人工接手。任务结束后若还要恢复浏览器、账号和测试数据,环境清理也会形成持续运维负担。Google 的安全建议包括限制执行环境权限、控制可访问网址、记录截图与动作,并尽量从干净且一致的界面状态开始。
高风险操作还涉及确认和异常处置。Google 的Computer Use 官方公告说明,安全决策可能要求用户批准后再继续;涉及敏感或不可逆操作时,不应按完全无人值守来估算。
逐项记录下面这些成本,避免模型账单掩盖其他开支:
- 模型调用:按任务记录输入、输出、思考和缓存 token,再乘以当前适用费率。
- 执行资源:记录浏览器、容器、虚拟机或 Mac 环境的实际占用与计费方式,不用 API 单价代替环境成本。
- 失败与重试:记录失败原因、追加调用次数和是否需要重置会话,不预设固定重试比例。
- 人工审核:统计确认次数、人工处理时长和升级处理事件。
- 环境维护:统计镜像更新、权限配置、测试数据准备、会话隔离和故障排查投入。
- 并发与配额:核对每分钟请求数、每分钟输入 token 和每日请求数等限额。不同模型和项目的限制可能不同,具体以官方速率限制说明为准。
预算也不等于可用额度。账单账户状态、项目限制和额度上限会影响服务能否持续运行;用量查看和账单设置可参考官方 Gemini API 账单说明,并以你的项目实际状态为准。
用三类运行情景填预算表
不要先猜一个月的“平均 Agent 费用”。先确定任务量,再从真实测试任务测出单次调用、token 用量、失败处理和环境占用。任务差异明显时,应按类别分别核算。下表是填写结构,不是价格报价,也不预设任务量、重试率或 Mac 租赁费用。
| 情景 | 你要填写的工作量 | 模型成本输入 | 环境与人工成本输入 | 估算方式 |
|---|---|---|---|---|
| 低频试验 | 计划任务数、测试周期 | 每任务输入/输出 token、当前模型单价 | 环境启停或占用、人工确认次数与时长 | 任务数 × 单任务模型费用,再加实际环境与审核成本 |
| 持续回归测试 | 每轮用例数、每周执行轮次 | 各类用例的实测 token、失败后的追加调用 | 浏览器或虚拟机占用、排查与状态重置工时 | 按用例类别计算,再汇总每轮和每周期费用 |
| 多任务运行 | 并发任务量、实际运行周期 | 各任务实测 token、上下文回传量、当前费率 | 并发资源、隔离配置、值守与人工升级成本 | 汇总模型与环境账单,另列峰值并发和维护支出 |
为每个输入值记录来源和核对日期:模型价格查官方定价页;token 用量来自 Gemini API 响应;任务量来自你的调度计划;环境费用采用服务账单或供应方当期报价;人工成本按团队实际投入核算。若比较批处理或缓存,应分别填写适用费率与实际数据,不要将不同计费模式混为一谈。
独立开发者可以先挑一类真实任务,逐次记录调用和失败事件;QA 团队则可以将同一组用例分别放进浏览器自动化和目标桌面环境,判断模型费用变化是否抵消了环境运维差异。准备多任务运行时,还要考虑并发和配额:排队或限流后的重试会影响测试周期,但不能简单折算成模型单价上涨。
根据实测决定是否增加 Mac 环境
把 Mac 纳入测试的条件是什么? 当任务目标包含 macOS 原生应用、Safari 的指定行为或必须验证的系统权限,并且轻量浏览器环境无法复现时,再评估 Mac 执行环境。若任务始终局限于网页自动化,先把浏览器隔离、账号权限和重置流程做好;仅因为模型支持桌面操作就增加 Mac,可能会让你承担并不需要的运维工作。
AI Agent 执行环境该怎样选? 把原生应用覆盖率、任务稳定性、隔离要求和运维负担作为判断指标。先运行小规模真实任务,记下 API 用量、失败次数、人工介入和环境恢复情况;若某项目标只能由 macOS 环境完成,再将 Mac 的账单与维护成本放入预算。Google 当前模型列表可用于复核模型及工具支持范围,具体能力仍应结合对应的 Computer Use 文档确认。
扩大运行范围前,逐项勾选并保留记录:
- [ ] 选择代表性真实任务,记录每轮输入、输出及响应中可见的 token 用量。
- [ ] 记录每项任务的截图次数、动作数、失败点、追加请求和最终完成状态。
- [ ] 分列模型账单、执行资源、人工确认和环境维护,不合并成一个 API 单价。
- [ ] 在同一测试目标上验证浏览器、桌面或移动端环境;只有实际依赖 macOS 时,再比较 Mac 环境。
- [ ] 核实高风险动作的确认流程、可访问网站范围、权限隔离和任务结束后的状态清理。
- [ ] 执行持续或并发任务前,复核当前模型、价格、账单额度与速率限制。
模型支持 Computer Use,不代表 API 会代替你托管桌面;客户端动作循环和执行环境仍要由你落实。自购 Mac 适合长期、稳定占用且需要直接控制设备的工作负载;浏览器自动化适合目标明确局限于网页的任务。若当前方案是临时测试用的本地设备或通用桌面环境,可能会遇到设备闲置、环境难复现或无法覆盖 macOS 原生应用等问题;当你只需阶段性验证、且目标确实依赖 macOS 时,租赁 Macstripe 的 Mac 环境可作为自购之外的选项。你可以先用自己的任务量填完成本变量,再阅读 Macstripe 的 Mac 环境概览和香港节点配置与下单信息,确认环境是否匹配测试目标;若任务不需要 macOS,就继续使用更轻量的浏览器方案。