计费、配额与限速
按 Token 计费
Section titled “按 Token 计费”调用消耗以 Token 计,且输入与输出通常不同价(输出一般显著更贵)。此外还可能单独计价:
| 计费维度 | 说明 |
|---|---|
| 输入 Token(prompt) | 你发送的内容,含系统提示词、历史对话、工具定义 |
| 输出 Token(completion) | 模型生成的内容,含思考过程(若上游返回) |
| 缓存读 / 缓存写 | 命中前缀缓存时按更低单价计费,具体取决于上游是否支持 |
| 图像 / 多模态 | 图片按 Token 折算或按张计费,取决于模型 |
配额(Quota)与余额
Section titled “配额(Quota)与余额”ZiAI 用「配额」作为内部记账单位:
- 账户配额:你充值或获赠的总额度;
- 令牌配额:单个密钥可消耗的上限,可设「无限」(仍受账户总额度约束);
- 每次调用后,扣减额 = Token 数 × 模型倍率 × 分组倍率。
倍率(Ratio)
Section titled “倍率(Ratio)”| 倍率类型 | 影响 |
|---|---|
| 模型倍率 | 不同模型单价不同,旗舰模型显著高于轻量模型 |
| 分组倍率 | 不同「分组」可能享受不同折扣,密钥绑定的分组决定其倍率 |
| 补全倍率 | 输出相对输入的价格系数 |
分组的实际影响:如果你的密钥绑定了某个分组,那么它只能走该分组下的渠道,能用的模型和价格都随之变化。发现「某个模型用不了」或「比预期贵」时,先确认密钥的分组设置。
部分版本的控制台界面还支持:
- 在密钥行菜单「复制连接信息」,一键拿到地址与密钥;
- 把密钥「发送到受支持的客户端集成」,减少手工粘贴出错。
限速阈值由 ZiAI 的部署规模与上游渠道决定,常见限制维度:
| 维度 | 触发表现 |
|---|---|
| 每分钟请求数(RPM) | 短时间高频调用返回 429 |
| 每分钟 Token 数(TPM) | 长上下文请求更易触发 |
| 并发连接数 | 多个 Agent 同时跑长任务时出现排队或超时 |
| 上游渠道限速 | 表现为偶发失败后由 ZiAI 自动重试或切换渠道 |
收到 429 怎么办
Section titled “收到 429 怎么办”额度耗尽的表现
Section titled “额度耗尽的表现”额度用完时,不同客户端的错误提示差异很大,容易误判为「配置错了」:
| 你看到的 | 实际原因 |
|---|---|
insufficient_quota / 额度不足 / 余额不足 |
账户或密钥配额已用尽 |
| 401 / 403(此前一直正常) | 密钥过期、被禁用,或配额耗尽后被停用 |
| 操练场能用,客户端不能用 | 客户端配的模型 ID 不在该密钥的模型限制内 |
| 某个模型突然 404 / 模型不存在 | 站长下线了该渠道,或改了模型映射 |
排查第一步永远是操练场:https://api.ziai.lol/console/playground 能正常对话,就说明账号、额度、密钥都没问题,故障在客户端配置。
省 Token 的实用建议
Section titled “省 Token 的实用建议”- 上下文窗口不要盲目拉满 ZCode、WorkBuddy 等客户端允许调大上下文窗口(如 200K → 1M)。窗口越大,每轮重发的历史越多,消耗成倍增加。 除非确实在处理超长文档,保持默认即可。
- 长任务适时开新会话 对话历史累积到很长时,新开一个会话比继续聊更省。
- 简单任务用轻量模型 格式转换、文案润色、小段修改用便宜模型;复杂重构、多步推理再上旗舰模型。
- 关闭不必要的自动压缩保留 WorkBuddy 的「Max 模式」会全程保留上下文不做压缩,消耗明显更快,默认关闭即可。
- 给密钥设配额上限 跑批量脚本或交给他人使用时,用「剩余配额」设硬上限,避免意外超支。
- 用令牌级配额做成本隔离 为每个工具单独建密钥,就能在日志里按密钥看清钱花在哪。
发票、退款与充值
Section titled “发票、退款与充值”以上信息因站点运营方式而异,请查阅 ZiAI 控制台公告或联系站长获取。