GLM-5.1 是智谱面向智能体工程推出的新一代旗舰模型。它被设计为可以持续运行数小时甚至更久,并且在运行过程中不断改进自己的策略一一运行时间越长,结果越好。
| 服务商 | 上下文 | 最大输出 | 价格区间 | 输入(M/Tokens) | 输出(M/Tokens) | 缓存(M/Tokens) | 延迟 | 吞吐 | 稳定性 |
|---|---|---|---|---|---|---|---|---|---|
qianfan-cn | 200K | — | 输入Tokens [0, 32K) 输入Tokens [32K, +∞) | ¥3 ¥4 | ¥12 ¥14 | ¥0.7 ¥1 | 1.1 s | 86.2tps | 样本不足 |
wanqing-cn | 200K | — | 输入Tokens [0, 32K) 输入Tokens [32K, +∞) | ¥3.3 ¥4.4 | ¥13.2 ¥15.4 | ¥0.72 ¥1.1 | 1.7 s | 49.68tps | 样本不足 |
siliconflow-cn | — | — | 输入Tokens [0, 32K) 输入Tokens [32K, +∞) | ¥3.6 ¥4.8 | ¥14.4 ¥16.8 | ¥0.78 ¥1.2 | 1.5 s | 19.5tps | 样本不足 |
topenrouter-cn | 200K | — | 输入Tokens [0, 32K) 输入Tokens [32K, +∞) | ¥3.9 ¥5.2 | ¥15.6 ¥18.2 | ¥1.3 ¥2 | 4.9 s | 98.88tps | 样本不足 |
通过智能路由聚合多家服务商,保障调用稳定
curl https://api.tokplus.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $TOKGEN_API_KEY" \
-d '{
"model": "z-ai/glm-5.1",
"messages": [
{"role": "user", "content": "你好,介绍一下你自己"}
],
"stream": true
}'