跳转到内容

计费、配额与限速

调用消耗以 Token 计,且输入与输出通常不同价(输出一般显著更贵)。此外还可能单独计价:

计费维度 说明
输入 Token(prompt) 你发送的内容,含系统提示词、历史对话、工具定义
输出 Token(completion) 模型生成的内容,含思考过程(若上游返回)
缓存读 / 缓存写 命中前缀缓存时按更低单价计费,具体取决于上游是否支持
图像 / 多模态 图片按 Token 折算或按张计费,取决于模型

ZiAI 用「配额」作为内部记账单位:

  • 账户配额:你充值或获赠的总额度;
  • 令牌配额:单个密钥可消耗的上限,可设「无限」(仍受账户总额度约束);
  • 每次调用后,扣减额 = Token 数 × 模型倍率 × 分组倍率。
倍率类型 影响
模型倍率 不同模型单价不同,旗舰模型显著高于轻量模型
分组倍率 不同「分组」可能享受不同折扣,密钥绑定的分组决定其倍率
补全倍率 输出相对输入的价格系数

分组的实际影响:如果你的密钥绑定了某个分组,那么它只能走该分组下的渠道,能用的模型和价格都随之变化。发现「某个模型用不了」或「比预期贵」时,先确认密钥的分组设置。

部分版本的控制台界面还支持:

  • 在密钥行菜单「复制连接信息」,一键拿到地址与密钥;
  • 把密钥「发送到受支持的客户端集成」,减少手工粘贴出错。

限速阈值由 ZiAI 的部署规模与上游渠道决定,常见限制维度:

维度 触发表现
每分钟请求数(RPM) 短时间高频调用返回 429
每分钟 Token 数(TPM) 长上下文请求更易触发
并发连接数 多个 Agent 同时跑长任务时出现排队或超时
上游渠道限速 表现为偶发失败后由 ZiAI 自动重试或切换渠道

额度用完时,不同客户端的错误提示差异很大,容易误判为「配置错了」:

你看到的 实际原因
insufficient_quota / 额度不足 / 余额不足 账户或密钥配额已用尽
401 / 403(此前一直正常) 密钥过期、被禁用,或配额耗尽后被停用
操练场能用,客户端不能用 客户端配的模型 ID 不在该密钥的模型限制内
某个模型突然 404 / 模型不存在 站长下线了该渠道,或改了模型映射

排查第一步永远是操练场https://api.ziai.lol/console/playground 能正常对话,就说明账号、额度、密钥都没问题,故障在客户端配置。

  1. 上下文窗口不要盲目拉满 ZCode、WorkBuddy 等客户端允许调大上下文窗口(如 200K → 1M)。窗口越大,每轮重发的历史越多,消耗成倍增加。 除非确实在处理超长文档,保持默认即可。
  2. 长任务适时开新会话 对话历史累积到很长时,新开一个会话比继续聊更省。
  3. 简单任务用轻量模型 格式转换、文案润色、小段修改用便宜模型;复杂重构、多步推理再上旗舰模型。
  4. 关闭不必要的自动压缩保留 WorkBuddy 的「Max 模式」会全程保留上下文不做压缩,消耗明显更快,默认关闭即可。
  5. 给密钥设配额上限 跑批量脚本或交给他人使用时,用「剩余配额」设硬上限,避免意外超支。
  6. 用令牌级配额做成本隔离 为每个工具单独建密钥,就能在日志里按密钥看清钱花在哪。

以上信息因站点运营方式而异,请查阅 ZiAI 控制台公告或联系站长获取。