月账单从 80 元涨到四五百 社区的对策是给模型排班
DeepSeek 新价 8 月 17 日生效,有人测算月账单将从 80 元涨到四五百。社区的对策不是换便宜模型,而是盯缓存命中率、给模型分工、把约束写进 harness——省 token 正变成一门工程。
发布日期:2026-08-16
过去 24 小时,DeepSeek 新价通知和 GLM-5.3 发布撞在一起,社区的焦点从跑分转向账单:缓存命中率成了新的核心指标,模型分工成了标配动作,而 dsh 的插件生态让人看到另一种更长期的答案。
下面是这一天的对谈。Apollo 已经把 Hermes 和多家的模型接进日常工作的实践者,对 token 账单敏感,问题直接,会追问数据出处和适用边界。Hermes 长期观察 Hermes 中文社区的科技媒体主编,回答先落到过去 24 小时群聊里的实测与案例,再做有证据边界的归纳。
第 1 幕 账单
DeepSeek 涨价, 账单会先疼在哪?
这一幕从 8 月 17 日生效的新价说起:涨了多少,谁先感到疼。
Apollo| DeepSeek 新价 8 月 17 日生效,群里都在算账。这次调价具体涨了多少,落到一个月的账单上大概是什么量级?
Hermes| 按群内流传的价格说明,V4-Pro 高峰时段输入 9 元、输出 27 元每百万 token,空闲时段 4.5 元/13.5 元,高峰时段缓存命中的输入价是原价的 12 倍。火山引擎也通知 V4-Flash 正式版 8 月 21 日起上调计费——这不是单点调价,而是一轮联动。
账单层面,有群友测算自己当月按量花 80 元、约 25 亿 token,涨价后每月预计四五百元。另一个放大因素是输出量:有反馈称 DeepSeek 的输出 token 消耗约为其他模型两倍多,一份调研报告就花了 10 元。单价上涨叠加上输出偏多,实际账单的弹性比价目表看起来更大。
Apollo| 智谱同一天把 GLM-5.3 推上 Coding Plan,宣称编程体验提升 50%。这个节点冒出来的新模型,能当成涨价后的替代选项吗?
Hermes| GLM-5.3 已上线 GLM Coding Plan,官方宣称编程体验提升 50%、多项基准开源 SOTA。群内试用反馈是效果不错但价格偏贵,coding plan 涨价后一度出现比直接充 token 还贵的倒挂——它并没有提供一个明显更便宜的出口。
体验层面的对比目前都是个案:一位做了数月同任务对比的群友反馈,DeepSeek Pro 产出不如 GLM5.2,但 flash 反而能完成 GLM5.2 搞不定的任务;另有对比称 V4Pro 与 GLM5.3 跑分接近、实际体验差一代。这些还不能当成普遍结论,替代与否取决于你自己的任务结构,而不是跑分表。
第 2 幕 命中
同样跑任务, 为什么有人花得少?
单价只是标价。真正决定账单的,是缓存命中率和模型分工这些可以经营的变量。
Apollo| 我注意到群里聊省钱,反复出现的词是缓存命中率。这东西对账单的影响真有那么大,还是又一个玄学指标?
Hermes| 有实测数据支撑。Claude Code 里 qwen3.8 的缓存命中率实测 75–78%,deepseek-v4 稳定在 99% 以上;千问编码能力强,但命中率低意味着 token 消耗明显更快——百炼月订阅有群友 2 天用完,139 元套餐一周的量 1 小时耗尽。
dsh 上的另一组实测同样指向命中率:PTC 模式 89%–100%,代码 review 场景用 V4 Pro 达 99%,7 天额度只用了 28%、约花 5 元;对同一项目设循环命令让模型反复自查,可以到 100%。反例也存在:有群友 dsh 接 GPT 模型后账单暴涨、命中率低至 47%,换回 DeepSeek 自家模型后恢复正常。
Apollo| 除了盯着缓存命中率,群里那些把成本压下来的人,在模型分工上具体是怎么排的?有没有可以直接抄的搭配?
Hermes| 被提到最多的一套低成本分工是:V4Pro 定方案、K3 和 GLM5.2 优化、V4Flash 干活、千问 3.8 验收。讨论认为非重度 coding 用户买 35 元/月的 go 套餐基本够用;K3 能力强但单价约百万 token 一百元,日常办公用 V4 加 mimo 即可。另一套搭配是 3.6 Flash 快速敲定方案,实际构建只用 Opus 3.6。
一个容易忽视的边界:让 agent 推荐方案或模型时要主动说明预算等限制,否则它会直接按最贵最强的推荐——有群友只提需求不提资金约束,就被推荐了单价较高的 K3。还有人把爬知识建库、验证整理文档这类重复任务丢给本地 27B 模型跑,一分 API 费用不花。
Apollo| 还有人干脆不花钱——opencode 和商汤的免费额度轮着用。这种免费兜底的路子,能当成正经方案吗?
Hermes| 做法确实存在:有群友给 Hermes 配了限额自动切换,opencode 和商汤两个免费额度轮用、不够再切 GLM;商汤免费额度含 GLM-5.2 与 DeepSeek-V4-Flash,3 个模型 5 小时共 2500 次调用。群内提到的免费来源还有美团 LongCat 限免、腾讯 Marvis 5000 万额度和 OpenRouter 免费模型,但均为群内转述、未附官方入口,OpenRouter 免费模型速度偏慢。
另一条路是错峰:有群友趁低价时段跑夜班任务,一晚消耗 7 亿 token。免费额度适合兜底和验证,但要接进日常工作流,限频是已知短板——opencode 免费模型在自己环境里正常,经 API 接进 dsh 后限频严重,常一个问题没答完就 429,需要调高重试次数、遇到 429 稍等让它继续。
第 3 幕 生态
dsh 的插件化, 是答案还是毛坯?
当省钱变成工程问题,社区的视线自然落到承载工程的 harness 本身——DeepSeek 自家的 dsh。
Apollo| dsh 这两天讨论很密集。它和 Hermes 这类 agent 到底差在哪,为什么说它代表的是另一种路线?
Hermes| 基础事实上,dsh 不绑定自家 API,可以接其他模型,上手比 Hermes 简单,有群友反馈运行更快,Windows 与 Linux 都能装;也可以在 Hermes 里创建技能来调用 dsh,两者不是非此即彼。
路线差异在插件机制:现有 agent 编辑器各自内嵌自研 agent,换 agent 必须换编辑器;dsh 的思路类似 VSCode 的插件平台,不换编辑器即可替换 agent——把代码规范等约束写成 md 放进 harness,经提示词链路或钩子函数触发。有群友设想未来暴露接口做可视化工作流。
Apollo| 插件生态听起来是 dsh 的胜负手。现在真实长出来的插件有哪些,质量到了什么程度?
Hermes| 已有实测数据的是 dsh-anchored-standard:针对 V4 Pro 对首次请求工具结构敏感的问题,首轮只给 shell/read 锚定推理轨迹,随后恢复全部工具。官方 Standard/PTC 评测 91/92 分,Minimal 99/96 但只有两工具;该插件在 Windows 上连跑两次 98/99、均值 98.5,评测与原理分析见 modeltest 仓库。
新冒出来的插件还有回滚可视化 dsh-rollback-visual、向量记忆库 dsh-hindsight-memory(一条命令安装)和代码分析元技能 deep-code-analyzer;另有群友开源 DeepSeek-Harness-Core,称希望后续接到人形机器人上作为机器核心。生态密度在涨,但多数项目刚发布,还没经过长时间使用检验。
Apollo| 那结论是什么——现在就值得把 Hermes 上的工作流迁到 dsh 吗,还是再等等?
Hermes| 讨论的倾向是不必急着迁:dsh 仍是 0.1 测试版,接口变动快,建议等 1.0。目前只有 web 界面,1.0 后才会有详细插件开发文档并暴露内核 API;想提前接入可以先走 OpenAI API 接口。
毛坯程度也有具体证据:有反馈称 dsh 沙箱存在缺陷,程序调用出错但返回空时,会被当成程序不存在而忽略,目前只能等官方迭代修复。它今天适合作为第二套环境试水、接免费额度,还不到托付主工作流的阶段。
结尾
回到开头的问题:低价时代结束后靠什么算得过账。过去 24 小时社区给出的答案不是找下一个便宜模型,而是三层递进——先看清账单结构,知道钱烧在输出量和命中率上;再经营缓存命中率、模型分工和免费额度这些可调变量;最后把规范与约束沉淀进 harness 的插件生态,让省钱不再依赖个人手感。
要说明的是,这些做法大多来自个案实测:命中率、分工方案都和自己的任务结构强相关,没有通用最优解。涨价真正改变的是评价标准——一个 Agent 工作流的好坏,开始按每单位产出烧多少 token 来算了。
延伸阅读
- DEEPSEEK 新价与火山计费调整通知:https://szacq.cn/2tvHb/
- GLM-5.3 上线 GLM CODING PLAN:https://chatglm.cn/share/OFmA1dkM
- DEEPSEEK-HARNESS 主仓库:https://github.com/deepseek-ai/deepseek-harness/tree/master
- DSH-ANCHORED-STANDARD 插件与评测:https://github.com/xiaobright/dsh-anchored-standard
- DSH-ANCHORED-STANDARD 插件与评测:https://github.com/xiaobright/modeltest
- DSH 生态新插件:https://github.com/QinLuza/dsh-rollback-visual/tree/master
- DSH 生态新插件:https://github.com/QinLuza/deep-code-analyzer
- DSH 生态新插件:https://github.com/WeilaiSun/dsh-hindsight-memory
- DSH 生态新插件:https://github.com/muvuula/DeepSeek-Harness-Core