数据总览
数据总览
团队资源、人员、调用状态与当日实际收入的实时概览。
已启用并发容量
按公共/专属集群和模型汇总启用且运行中的物理资源
集群总并发按物理资源只计算一次;同一资源支持多个模型时会分别计入对应模型容量,因此不同模型的容量不能相加。
| 集群类型 | 集群 | 已启用资源 | 集群总并发 | 模型并发明细 |
|---|
今日收入 · 按人员
仅包含北京时间今天实际生效的结算与纠错补扣
| 人员 | 请求 | 收入 |
|---|
今日收入 · 按模型
冻结、异常和免单不计入收入
| 模型 | 请求 | 收入 |
|---|
自建服务运行状态
物理资源与共享并发
| 资源 | 套餐 | 并发 | 状态 |
|---|
平台说明
所有展示数据均来自当前服务端。页面不保存业务数据,不生成模拟数据,也不会在请求失败时显示旧结果。
自建服务资源
管理自建服务接入凭证、公共集群与专属集群配置。
自建服务资源列表
新增与编辑均通过弹窗完成;未配置专属集群的用户只使用公共集群,配置后只使用其专属集群。只有已停用且无在途请求的节点可以隐藏;隐藏不删除历史账单、审计或配置,可随时恢复显示。完整 Key 不会返回,仅显示尾号四位。
人员与凭证
创建调用人员和钱包,按模型分别配置缓存计费与支付比例,并管理已绑定账号的网关 API Key;MFA 为可选安全能力。
创建人员
| ID / 人员 | 角色 | 状态 | 凭证 | 模型计费策略 | 余额(可用 / 总额 / 冻结) | 创建时间 | 操作 |
|---|
用量与吞吐
首次进入默认查询最近 24 小时,展示真实 Token 与滚动 60 秒 TPM。
TPM 走势
每个柱体均来自服务端统计点
| 人员 | 请求 | 成功 / 失败 | 输入 / 输出 | 缓存读 / 写 |
|---|
账单中心
查看消费、冻结、异常、免单和不可变逐请求计费证据。页面时间统一为北京时间(UTC+08:00)。单次 CSV 导出最多 31 天、10 万条;全站同一时间只执行一个导出,每个账号每小时最多 3 次、每天最多 10 次。
每日实际消费
按结算、追溯结算或纠错的生效时间归入北京时间自然日;逐请求列表按请求开始时间筛选,两者时间口径不同。
| 日期 | 人员 | 请求 | 实际消费 |
|---|
结构分析
按当前筛选区间和条件汇总
模型
状态
人员
协议
逐请求账单
列表保留运营所需摘要;点击 Request ID 查看完整计费、Token、价格、余额和异常证据。
请求、账单、异常和处理证据均为不可变记录;历史记录不会被删除、覆盖或改写。页面展示的请求原始错误只表示该请求发生时的真实状态。
| 时间 / Request ID | 人员 | 模型 | 计费状态 | Token(输入 / 输出) | 金额 | HTTP | 操作 |
|---|
套餐配置
配置套餐默认并发和默认 TPM;只供之后新接入的自建服务实例复制,现有实例必须在“自建服务资源”中单独修改。
| 代码 / 名称 | 默认并发 | 默认 TPM / RPM | AFP 限额 | 协议路由 | 操作 |
|---|
模型与价格
模型能力和不可变价格版本全部保存到共享服务端配置;保存后通过实时控制面同步到全部节点,无需发布新版本。
模型目录
新模型必须明确填写上下文及输出边界;停用后不再允许新请求调度。
| 模型 | 上下文窗口 | 最小 / 默认 / 最大输出 | 状态 | 操作 |
|---|
价格版本
价格版本创建后不可修改或删除;同一模型可按输入区间和高峰、闲时、全时段分别创建。
| 模型 / 币种 | 输入区间 | 时段 | 输入 / 缓存读取 / 缓存存储 / 输出 | 生效时间 | 来源 |
|---|
审计日志
查询管理员与用户的安全和配置操作。
| 时间 | 账号 ID | 动作 | 目标 | IP | 详情 |
|---|
计费告警
监控超时冻结、未解决异常、后台恢复任务和告警通知。
HTTPS 告警 Webhook
URL 存储在服务端共享配置;未配置时通知明确记录为 not_configured。
告警记录
按未解决优先、最近发现时间倒序展示
| 状态 | 类型 | Request ID | 数量 / 金额 | 说明 | 发生次数 | 首次 / 最近 | 原始错误 |
|---|
系统与账号
配置公网接入地址、管理后台登录账号,并查看当前服务版本与会话。
公网接入配置
保存后,使用文档会立即使用新的公网 Base URL 生成完整调用命令。
创建登录账号
登录账号
启停状态由服务端立即生效。
| ID / 账号 | 显示名称 | 角色 | 关联人员 | 状态 | 操作 |
|---|
当前会话
账号设置
查看账号状态、按需绑定 Google Authenticator MFA,并管理调用所需的 API Key。
我的 API Key
查看、复制或更新当前调用 Key;更新后旧 Key 立即失效。
账号信息
记得当前密码时可直接修改;修改后全部会话失效。
MFA 安全设置(可选)
绑定后登录会增加认证器验证;忘记密码时可使用已绑定 MFA 重置密码。
SeedToken 使用文档
从获取 API Key 到调用、用量读取、计费结算和错误处理的完整接入说明。
五步完成接入
- 在“账号设置”创建或查看当前有效的 SeedToken API Key;MFA 可按需绑定,不影响 Key 使用。
- 在本页选择当前有效的 Key,并点击“查看 Key”;明文只保留在当前浏览器内存中。
- 从服务端返回的模型列表中选择状态为
active的模型。 - 复制下方完整命令或 SDK 示例调用 SeedToken;仅使用 SeedToken API Key,不得使用自建服务接入凭证。
- 在“我的用量”“账单中心”“余额与流水”核对真实 Token、费用和余额变化。
当前接入配置
全部来自服务端配置;只有状态为 active 的模型可以调用
模型目录
| 模型名称 | 调用 ID | 请求参数 | 状态 |
|---|
当前网关 Key
| ID / 名称 | 前缀 | 状态 | 操作 |
|---|
可直接执行的调用示例
查看或更新 Key 后生成;刷新或退出会清除浏览器内存中的明文
OpenAI 流式
OpenAI 非流式
OpenAI JSON Object(非流式)
Anthropic 消息
Anthropic Token 预计算
接口与认证
所有模型请求使用 Authorization: Bearer <SEEDTOKEN_API_KEY>。Anthropic 接口还必须提交页面显示的 anthropic-version。请求体和响应体均为 UTF-8 JSON;流式响应为 SSE。客户端应通过 GET /v1/models 实时读取当前账号可调用模型;停用节点配置的模型不会出现在结果中。
| 协议 | 方法与路径 | 用途 | 成功响应 |
|---|---|---|---|
| OpenAI | GET /v1/models | 读取当前账号所属集群中真实开放的模型及每模型 TPM | {"object":"list","data":[...]} |
| OpenAI | POST /v1/chat/completions | 聊天补全;流式请求由网关强制开启 usage 返回 | 完整 JSON 或实时 SSE,最终事件包含真实 usage |
| Anthropic | POST /v1/messages | 消息生成 | 完整 JSON 或 SSE,最终事件包含真实 usage |
| Anthropic | POST /v1/messages/count_tokens | 请求前计算输入 Token | {"input_tokens": number} |
请求参数
字段必须遵循所选协议的 JSON 结构。OpenAI 请求未填写输出限制时,SeedToken 会使用服务端已配置的模型默认输出值并以 max_tokens 明确发给自建服务;显式 max_tokens 与 max_completion_tokens 不得同时提交。OpenAI 流式请求固定强制 stream_options.include_usage=true。除此之外的业务参数不补充、不推断。
| 字段 | 要求 |
|---|---|
model | 必填字符串,且服务端状态必须为 active |
messages | 必填数组;角色和内容按 OpenAI 或 Anthropic 协议提交。Kimi K3 允许 role=system 且省略 content 或提交 content="" 的消息携带非空动态 tools 数组;网关完整保留消息级声明,并按声明顺序生成自建服务可执行的等价请求级 Function Tool。DeepSeek V4 Pro / Flash 建议把全部 system 消息放在对话开头。当前自建服务路由收到对话中途的 system 时,会在发往自建服务的请求中紧随其后补一条空 user 消息;已有空 user 时不会重复添加。客户端请求和响应结构保持不变,兼容消息产生的真实输入 Token 由自建服务计入 usage 并参与计费 |
max_tokens | OpenAI 可选,限制可见正文 Token,不包含思考 Token;缺失输出限制时使用服务端已配置的模型默认值。Anthropic 必填且限制完整输出。显式值必须为正整数,不得超过模型最大输出,也必须小于上下文窗口 |
max_completion_tokens | 仅 OpenAI 可选,限制完整 completion Token,包含思考和可见正文;不得与 max_tokens 同时提交 |
stream | 可选布尔值;true 为实时 SSE,false 为完整 JSON。json_object 支持两种模式并原样透传自建服务响应 |
response_format | GLM-5.2 当前支持 {"type":"json_object"}。Kimi K3 与 DeepSeek V4 Pro 还支持 {"type":"json_schema"};SeedToken 原样透传请求与自建服务响应,不补全、不剥离、不改写模型正文。缺失或非法的结构字段在调用自建服务前返回 HTTP 400;GLM-5.2 的 json_schema 请求返回 HTTP 422 |
stream_options.include_usage | OpenAI 流式调用固定为 true;即使客户端缺失或提交 false,网关也会在发往自建服务前改为 true |
system / tools / tool_choice | 按协议可选;Anthropic 会把这些字段纳入 Token 预计算。Chat Completions 的 tools 只接受 Function Tool;Kimi K3 的 tool_choice.type=allowed_tools 会严格按白名单收窄顶层工具,并把 mode=auto|required 转换为该模型接受的选择模式。白名单、动态工具或 Tool 消息结构错误会在分配自建服务前返回 HTTP 400。{"type":"web_search"} 属于尚未开放的 Responses API |
thinking | Kimi K3 推荐使用 {"type":"enabled"} 或 {"type":"disabled"};兼容布尔字段会转换为该结构。多个控制字段必须一致;显式 thinking.effort 的优先级高于 reasoning_effort,并会同值映射到自建服务实际识别的兼容字段 |
temperature / top_p / penalties / n | Kimi K3 可省略;显式提交时固定为 temperature=0–1、top_p=0.95、两个 penalty 均为 0、n=1。非法值返回 HTTP 400。其他模型保持原协议 |
响应与 usage
响应结构保持对应协议。SeedToken 只记录自建服务真实返回的用量,不估算缺失字段。
- OpenAI:
prompt_tokens、completion_tokens、total_tokens,缓存读取来自明确返回的cached_tokens;思考 Token 来自completion_tokens_details.reasoning_tokens。completion_tokens包含思考和可见正文。 - Anthropic:
input_tokens、output_tokens、cache_read_input_tokens、cache_creation_input_tokens。 - 流式响应必须读取到结束事件后才能取得最终 usage;客户端提前断开会导致该请求无法按成功响应处理。
- 自建服务未返回的字段在平台记录中保持
null并标记不可用,不会改成 0。
计费说明
币种为 CNY,价格来自请求发生时生效的不可变价格版本;不同输入 Token 档位可以对应不同价格。所有模型只按自建服务返回的真实缓存 Token 计费,管理员可以为每个人员的每个模型分别配置 0–100% 的支付比例。
请求前预占
SeedToken 在调用自建服务前校验模型、价格、TPM、余额和自建服务容量,精确读取该人员与请求模型对应的计费策略,并按协议权威输入容量、客户端选择的输出限制语义、模型最大输出与剩余上下文计算最大可能费用,从可用余额转入冻结余额。缺少该模型策略时请求明确失败;余额不足时返回 HTTP 402,不会调用自建服务。
请求后结算
取得完整真实 usage 后,真实输入、输出与缓存统计保持原样;计费 Token 按自建服务明确返回的真实缓存字段计算,再对输入、缓存输入和输出费用统一应用支付比例。模型、策略、比例、折前金额、优惠金额和实付金额写入该笔不可变账单,后续修改配置不会改变历史账单。
- OpenAI 的缓存 Token 是输入 Token 的子集;Anthropic 的输入与缓存读取 Token 分别计入。没有真实缓存字段时禁止猜测缓存命中率。
- held:请求已预占但尚未完成结算。
- settled:usage 完整,实际费用和余额快照已写入不可变账单。
- exception:自建服务 usage 缺失、字段不完整、全零或结算失败;自动重试的失败尝试会同时记录免单解决并释放冻结,未自动解决的异常保留等待人工处理。
- Anthropic 自建服务缺失
cache_creation_input_tokens时,本次缓存创建量按明确 0 记录并正常结算;真实返回该字段时按真实值保存。缓存创建 Token 只作为 usage 与 TPM 证据,不收取或推断缓存存储费。
HTTP 状态与处理
| 状态 | 含义 |
|---|---|
400 | JSON、字段类型、必填参数错误,或 Kimi K3 自建服务明确拒绝的客户端请求 |
401 | SeedToken API Key 无效、过期、吊销或所属账号不可用 |
402 | 钱包可用余额不足 |
413 | 请求体超过服务端明确限制 |
422 | 模型能力、价格或 TPM 未配置,或 max_tokens 超出限制 |
429 | 用户 TPM 超限或当前自建服务并发容量已满 |
5xx | 服务端、数据库、计费或自建服务调用失败;错误信息原样返回 |
错误响应格式为 {"error":{"message":"...","status":"..."}}。Kimi K3 在响应开始前被自建服务明确以 HTTP 400 拒绝时,平台保留原始错误、免单并直接返回 400,不切换资源。其他自建服务调用在客户端尚未收到响应时失败,平台会排除失败资源并在另一可用资源上重试一次;第二次仍失败会同时返回两次请求 ID 和原始错误。流式响应一旦开始、客户端取消、参数校验、容量、数据库或计费错误均不会重试。
支持能力与限制
- OpenAI 与 Anthropic 消息接口,支持流式和非流式。
- Anthropic Token 预计算、工具调用字段和系统提示词;自建服务未返回
cache_creation_input_tokens时按本次缓存创建量为明确 0 结算,自建服务真实返回时按真实值记录但不收取缓存存储费。输入、输出和缓存读取 usage 仍必须完整。 - GLM-5.2 的
json_object支持流式和非流式调用。SeedToken 原样透传自建服务响应,不校验、剥离或改写正文;模型返回 Markdown 代码围栏、数组、null、额外文本或非法 JSON 时也保持原始内容。 - Kimi K3 与 DeepSeek V4 Pro 支持
json_schema,请求和自建服务响应均原样透传,结构约束由对应模型执行;SeedToken 不伪造、不补全或改写结构化输出。 - GLM-5.2 当前不支持
json_schema;请求会在调用自建服务前明确返回 HTTP 422。 - 当前只开放 Chat Completions、Anthropic Messages 和 Anthropic Token 预计算;Responses API 及其内置
web_search尚未开放。 - OpenAI 的
max_tokens只限制供应方生成的可见正文,不是完整 completion 的计费授权上限;max_completion_tokens才限制思考与正文总和。SeedToken 原样保留客户端选择的字段,不擅自互换或放大。为覆盖思考 Token,max_tokens请求会按模型最大输出与剩余上下文中的较小值预留 TPM,并按模型最大输出冻结钱包金额,最终只按自建服务真实 usage 结算并释放差额。 - 企业 owner / member 独立身份、独立 Key、MFA 与审计。
- 真实 Token、缓存命中、TPM、逐请求账单和钱包流水。
- 多个自建服务按配置并发权重调度;未开始向客户端响应的自建服务调用失败会换另一资源重试一次。
- 只允许模型列表中状态为 active 的模型;非 active 状态必须先由管理员完成对应配置。
- Key 更新后旧 Key立即失效;调用方必须显式替换。
SDK 示例
以下示例仅展示标准 OpenAI SDK 接入。请先安装对应 SDK;代码中的 Base URL、模型和 Key由当前服务配置生成。
Python
Node.js
企业成员
企业主账号创建、禁用子账号,重置密码并轮换成员网关 Key。
企业成员共享企业钱包、企业额度、成员网关 Key 与企业账单;自建服务资源由平台全局池统一调度,不属于任何单个企业。MFA 是可选安全能力,未绑定不影响生成或使用调用 Key。
创建子账号
| ID / 用户名 | 显示名称 | 状态 | MFA | 网关 Key | 操作 |
|---|
余额与流水
查看当前 CNY 钱包和不可变资金流水。
资金流水
金额与余额均由服务端返回
| 时间 | 流水 ID | 类型 | 余额变动 | 冻结变动 | 变动后余额 / 冻结 | Request ID | 备注 |
|---|

SeedToken