Tokens 调用量趋势

最近 30 天 · 按 Top 5 模型 Tokens 堆叠(百万 tokens/天

GLM 5.2
DeepSeek V4 Pro
DeepSeek V4 Flash
Kimi K2.7 Code
Kimi K2.6

上架模型

7 个模型可供调用

深度求索: DeepSeek V4 Flash
deepseek/deepseek-v4-flash
发布时间 2026/04/24

DeepSeek-V4-Flash 是 DeepSeek 最新开源的混合专家(MoE)模型,总参数量达 2840 亿,推理时仅激活 130 亿参数,在保持极快推理速度的同时兼顾强大性能。原生支持 100 万 token 超长上下文,并提供 Non-Think、Think High、Think Max 三种推理模式,可按任务复杂度灵活切换,以 MIT 协议完全开放。

上下文长度1M输入(M/Tokens):¥0.6输出(M/Tokens):¥1.2缓存(M/Tokens):¥0.02
深度求索: DeepSeek V4 Pro
deepseek/deepseek-v4-pro
发布时间 2026/08/13

DeepSeek-V4-Pro 是 DeepSeek 旗舰级开源 MoE 模型,总参数量高达 1.6 万亿,推理时激活 490 亿参数,专为前沿推理、代码生成与 Agent 任务设计。原生支持 100 万 token 超长上下文,并提供三档推理模式;在 LiveCodeBench 和 Codeforces 等代码基准上达到顶尖水准,性能比肩主流闭源模型,以 MIT 协议完全开放

上下文长度1M输入(M/Tokens):¥2.7输出(M/Tokens):¥8.1缓存(M/Tokens):¥0.15
智谱AI: GLM 5.2
z-ai/glm-5.2
发布时间 2026/06/16

GLM-5.2 是智谱迄今能力最强的开源模型,面向长程智能体工程打造,并支持真正可用的 1M token 上下文窗口。它能在超长任务中完整保持项目状态,减少反复压缩和丢弃上下文的损耗——任务越长,越能记得住、推得动。

上下文长度1M输入(M/Tokens):¥3.2输出(M/Tokens):¥11.2缓存(M/Tokens):¥0.8
月之暗面: Kimi K2.6
moonshot-ai/kimi-k2.6
发布时间 2026/04/20

Kimi K2.6 是月之暗面(Moonshot AI)开源的原生多模态智能体模型,在 HLE(含工具)、SWE-Bench Pro、BrowseComp 等多项主流榜单上取得开源最优水平。 模型采用 MoE 架构,总参数量 1T,激活参数 32B,支持 256K tokens 上下文,并通过 MoonViT 视觉编码器支持图像与视频输入。 K2.6 专为智能体场景优化:支持 4,000+ 次工具调用与超 12 小时持续自主执行;多智能体协作可扩展至 300 个并行子智能体 × 4,000 步,单次运行生成 100+ 文件;同时支持思考(Thinking)与即时(Instant)双推理模式,以及 Function Call 与多轮思维链保留能力

上下文长度256K输入(M/Tokens):¥3.9输出(M/Tokens):¥16.2缓存(M/Tokens):¥1.1
智谱AI: GLM 5.1
z-ai/glm-5.1
发布时间 2026/04/07

GLM-5.1 是智谱面向智能体工程推出的新一代旗舰模型。它被设计为可以持续运行数小时甚至更久,并且在运行过程中不断改进自己的策略一一运行时间越长,结果越好。

上下文长度200K输入(M/Tokens):¥3输出(M/Tokens):¥12缓存(M/Tokens):¥0.7
月之暗面: Kimi K2.7 Code
moonshot-ai/kimi-k2.7-code
发布时间 2026/06/12

Kimi K2.7 Code 是一个专注于代码能力的 agentic 模型,基于 Kimi K2.6 构建。 相比 Kimi K2.6,它在真实世界的长链路编程任务上有显著提升,能够在复杂的软件工程工作流中实现更强的端到端任务完成能力;同时在 token 使用效率上也有所优化,与 Kimi K2.6 相比,推理token的使用量降低了约 30%。

上下文长度256K输入(M/Tokens):¥3.25输出(M/Tokens):¥13.5缓存(M/Tokens):¥1.3
深度求索: DeepSeek V3.2
deepseek/deepseek-v3.2
发布时间 2025/12/01

DeepSeek-V3.2 是一款兼具高计算效率与卓越推理和 Agent 性能的模型。其方法建立在三大关键技术突破之上:DeepSeek 稀疏注意力(DSA),一种高效的注意力机制,在保持模型性能的同时显著降低了计算复杂性,并特别针对长上下文场景进行了优化;可扩展的强化学习框架,通过该框架,模型性能可与 GPT-5 相媲美,其高算力版本在推理能力上可与 Gemini-3.0-Pro 匹敌;以及大规模 Agent 任务合成管线,旨在将推理能力整合到工具使用场景中,从而提高在复杂交互环境中的指令遵循和泛化能力。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中取得了金牌表现。

上下文长度160K输入(M/Tokens):¥2输出(M/Tokens):¥3缓存(M/Tokens):¥0.2
硅基流动 · 服务商详情 | TokenPlus