Tokens 调用量趋势

最近 30 天 · 按 Top 5 模型 Tokens 堆叠(百万 tokens/天

DeepSeek V4 Flash 0731
GLM 5.2
GLM 5
DeepSeek V4 Pro
GLM 5.1

上架模型

8 个模型可供调用

深度求索: DeepSeek V4 Flash 0731
deepseek/deepseek-v4-flash-0731
发布时间 2026/07/31

DeepSeek-V4-Flash-0731 是 DeepSeek-V4-Flash 的官方正式版本,取代了预览版,并大幅增强了智能体(agentic)能力。其模型结构与 DeepSeek-V4-Flash-DSpark 相同,即附带了一个推测解码(speculative decoding)模块。

上下文长度1M输入(M/Tokens):¥0.9输出(M/Tokens):¥2.7缓存(M/Tokens):¥0.05
深度求索: DeepSeek V4 Flash
deepseek/deepseek-v4-flash
发布时间 2026/04/24

DeepSeek-V4-Flash 是 DeepSeek 最新开源的混合专家(MoE)模型,总参数量达 2840 亿,推理时仅激活 130 亿参数,在保持极快推理速度的同时兼顾强大性能。原生支持 100 万 token 超长上下文,并提供 Non-Think、Think High、Think Max 三种推理模式,可按任务复杂度灵活切换,以 MIT 协议完全开放。

上下文长度1M输入(M/Tokens):¥0.6输出(M/Tokens):¥1.2缓存(M/Tokens):¥0.02
深度求索: DeepSeek V4 Pro
deepseek/deepseek-v4-pro
发布时间 2026/08/13

DeepSeek-V4-Pro 是 DeepSeek 旗舰级开源 MoE 模型,总参数量高达 1.6 万亿,推理时激活 490 亿参数,专为前沿推理、代码生成与 Agent 任务设计。原生支持 100 万 token 超长上下文,并提供三档推理模式;在 LiveCodeBench 和 Codeforces 等代码基准上达到顶尖水准,性能比肩主流闭源模型,以 MIT 协议完全开放

上下文长度1M输入(M/Tokens):¥2.7输出(M/Tokens):¥8.1缓存(M/Tokens):¥0.15
智谱AI: GLM 5.2
z-ai/glm-5.2
发布时间 2026/06/16

GLM-5.2 是智谱迄今能力最强的开源模型,面向长程智能体工程打造,并支持真正可用的 1M token 上下文窗口。它能在超长任务中完整保持项目状态,减少反复压缩和丢弃上下文的损耗——任务越长,越能记得住、推得动。

上下文长度1M输入(M/Tokens):¥3.2输出(M/Tokens):¥11.2缓存(M/Tokens):¥0.8
智谱AI: GLM 5
z-ai/glm-5
发布时间 2026/02/12

GLM-5 是智谱的基座模型,面向 Agentic Engineering 打造,能够在复杂系统工程与长程 Agent 任务中提供可靠生产力。在 Coding 与 Agent 能力上取得开源 SOTA 表现,真实编程场景使用体感逼近 Claude Opus 4.5。参数规模扩展至 744B(激活 40B),首次集成 DeepSeek Sparse Attention。

上下文长度200K输入(M/Tokens):¥2输出(M/Tokens):¥9缓存(M/Tokens):¥0.5
月之暗面: Kimi K2.6
moonshot-ai/kimi-k2.6
发布时间 2026/04/20

Kimi K2.6 是月之暗面(Moonshot AI)开源的原生多模态智能体模型,在 HLE(含工具)、SWE-Bench Pro、BrowseComp 等多项主流榜单上取得开源最优水平。 模型采用 MoE 架构,总参数量 1T,激活参数 32B,支持 256K tokens 上下文,并通过 MoonViT 视觉编码器支持图像与视频输入。 K2.6 专为智能体场景优化:支持 4,000+ 次工具调用与超 12 小时持续自主执行;多智能体协作可扩展至 300 个并行子智能体 × 4,000 步,单次运行生成 100+ 文件;同时支持思考(Thinking)与即时(Instant)双推理模式,以及 Function Call 与多轮思维链保留能力

上下文长度256K输入(M/Tokens):¥3.9输出(M/Tokens):¥16.2缓存(M/Tokens):¥1.1
智谱AI: GLM 5.1
z-ai/glm-5.1
发布时间 2026/04/07

GLM-5.1 是智谱面向智能体工程推出的新一代旗舰模型。它被设计为可以持续运行数小时甚至更久,并且在运行过程中不断改进自己的策略一一运行时间越长,结果越好。

上下文长度200K输入(M/Tokens):¥3输出(M/Tokens):¥12缓存(M/Tokens):¥0.7
月之暗面: Kimi K2.7 Code
moonshot-ai/kimi-k2.7-code
发布时间 2026/06/12

Kimi K2.7 Code 是一个专注于代码能力的 agentic 模型,基于 Kimi K2.6 构建。 相比 Kimi K2.6,它在真实世界的长链路编程任务上有显著提升,能够在复杂的软件工程工作流中实现更强的端到端任务完成能力;同时在 token 使用效率上也有所优化,与 Kimi K2.6 相比,推理token的使用量降低了约 30%。

上下文长度256K输入(M/Tokens):¥3.25输出(M/Tokens):¥13.5缓存(M/Tokens):¥1.3
快手万擎 · 服务商详情 | TokenPlus