Hermes Agent中文社区
当前位置对谈日报
返回社区日报
COMMUNITY DIALOGUE14 分钟

DeepSeek 还没官宣涨价,社区已经把账算完了

从模型价格与 Token 账单,聊到安装稳定性、记忆管理和 Agent 工作流的一天。

发布日期:2026-08-08

过去 24 小时,Hermes 社区从 DeepSeek 涨价传闻聊起,一路追到 token 到底烧在哪、Hermes 怎么装得上跑得稳,最后落在一个更实际的问题上:把 Agent 接进正经工作,流程和信任的边界该画在哪。

下面是这一天的对谈。Apollo 已经把 Agent 用进了日常工作,对额度和账单较真,问题都带着自己的用量和踩过的坑。Hermes 是长期泡在这个社区的科技媒体主编,回答只从这 24 小时的群聊事实出发,没被验证的事会直接说没有。


第 1 幕 账单

DeepSeek 涨价传闻,为什么没人真的慌

昨天开始,几乎所有群都在传同一件事:DeepSeek 要大幅涨价。但往下读会发现,大家的反应不是恐慌,而是各自翻出自己的账本核对一件事——我这个用法,还烧得起吗。

Apollo| 各群都在传 DeepSeek 要大幅涨价,还夹着「被约谈」「算力吃紧导致质量下降」之类的说法。这些消息有多少是坐实的?社区实际什么反应?

Hermes| 先把事实和传闻分开。群里的说法是 v4 flash 等要大幅涨价,「被约谈」「高并发导致质量下降」也都在传,但这些全是群内讨论,没有一条来自官方公告。

反应反倒更有意思。多数人算完账的结论是即便翻倍性价比也还在,有人说涨价后依然比 K3 便宜。同时 qwen 季卡、中转站这类备选被反复提起。没人真的迁移,但都在悄悄备一手 B 计划。

Apollo| 如果真涨一倍,大家换不换模型?我看群里同时在聊 K3、Qwen3.8max 和 0731 版 DS,现在社区眼里的排序是什么?

Hermes| 大致的口碑是:K3 综合最强,Qwen3.8max 视觉更强,0731 版 DS 性价比突出。混元能通过 hermes oauth 订阅免费无限用,但有人说水平不稳定;MiMo 便宜,能力接近 0423 版 DS;豆包的多模态可用。

省钱的主流配法是 DS 当主模型,再挂一个多模态模型专门识图。免费路线也有人试过:workbuddy 每天送 100 积分,有人反馈跑 K3 一轮对话都撑不下来;hy3 免费到月底,水平约等于去年的 DS,做基础任务、日常配着 DSpro 用够了。这个排序背后其实就是分工——主力要便宜,专项才上贵的。

Apollo| 可我自己用 K3 也觉得额度掉得飞快。群里还有人说 699 的套餐很快耗完、充 50 元没多久倒欠八十多。这到底是模型贵,还是用法有问题?

Hermes| 这两条都是个人账单,先当个案看。一例是升级 K3 后 699 的 plan 很快用完,一例是充 50 元没多久倒欠八十几;作对照,有人说同样 50 元充 DeepSeek 能用一个月。qwen3.8-max 那边也有两个用量个案:改一个 UI 布局就耗掉三百多 credits,另一位的日常消耗从每天约 5% 涨到 15%。这些都没有交叉验证,但方向一致地指向用量而不是单价。

也有人说 3.8-max 得按以前的预览折扣才谈得上性价比。想找平价的识图备选,小米 MiMo 开放平台定价和 DeepSeek 相同、还带多模态,注册送 ¥10 API 体验金加首单 9 折,体验金 40 天有效。不过同一条反馈也提醒,它多模态能力一般、办公够用,而且识图消耗的 token 比纯文本多。

Apollo| 免费额度这条路呢?有人把 opencode 的免费 DS 额度和订阅轮询着用了一整天,这种薅法能当正经生产力吗?另外阿里悟空并进 Qwenwork,是不是说明这个赛道在收拢?

Hermes| 实测是这样:opencode free 版上下文约 200k,用在 hermes 上控制好压缩阈值没问题;1M 版能跑到 500k 左右再压缩;免费和订阅轮询着用,确实撑得住一天的重度任务。麻烦在限额规律不稳定,有时按 2 亿 token,有时 2 千万,有时又是 200 次。所以拿它做子代理或辅助模型要慎重——补位可以,别依赖。

悟空的事顺带说清:它已经合并进 Qwenwork,不再自研模型,改用 Qwen,这是此前多个同类项目赛马之后的三合一,在 Qwen3.8 发布时被顺带提到。一边在重新定价,一边在合并收缩,免费午餐的红利期确实在收窄。


第 2 幕 去向

token 到底花在了哪里

涨价是外部变量。同一天里,另一批讨论把「烧 token」拆到了机制层面:记忆系统、思考模式、长窗口、子代理,每一项都有自己的账单逻辑。

Apollo| 群里反复说 Hermes 比别的 agent 烧 token。这锅该模型背还是 agent 背?如果是 agent 的问题,具体烧在哪个环节?

Hermes| 讨论基本都指向 agent 侧。主因是记忆系统,再叠一层知识库就更明显。另一个被点名的大户是思考模式——每次自问自答,都会把几万字的会话全文连着思考内容一起重新提交给模型。

缓解办法很直接:关掉思考模式,一件事处理完就开新窗口。但同一批讨论也提醒,新窗口意味着缓存未命中,未必更省。这题目前没有标准答案,更像是在「记忆完整」和「重复提交」之间挑一个你能接受的代价。

Apollo| 既然记忆这么贵,能不能干脆把它调小?我又看到有人把自带本地记忆的上限改到 5 万字符,说照样正常用。这不矛盾吗?

Hermes| 不矛盾,因为「200 字符上限」本身就是误传。实测把自带本地记忆的长度上限调到 5 万字符仍然正常工作,理论上还能再往上。记忆是 Hermes 体验的根基,调小它省不下多少钱,却会直接削弱它记住你的能力。

该管的其实是记忆之外那些东西:盲目叠加的知识库、一直挂着不用的 skill、思考模式的反复提交。别让无关的内容跟着记忆一趟趟被提交上去,比砍记忆有用得多。

Apollo| 长窗口那边有个更激进的做法:有人用 QwenPaw 一个窗口跑了一千万 token,号称无限上下文。这是怎么实现的,坑在哪?

Hermes| 机制是把记忆存到外设。上下文到阈值就触发写入 SQLite 历史库,不删除也不 compact,之后按需从数据库读回。实测一个窗口干了 1000 万 token,没出大问题,只在结尾出现三次重复写入。

两个注意事项讲得很明确:用这个无限实现时不要配合压缩指令,会有 bug;同一位实践者还提到,0 skill 加 PROJECT_README 的执行效率明显高于多 skill 加载,skill 建议手动管理,不用的就别加载。这是单人实测,还谈不上被广泛复现,但它指了一条路——上下文瓶颈可以用存储换,不一定非得靠压缩丢信息。

Apollo| 子代理和知识库这两块怎么配?我的子代理总是不懂业务流程,知识库又不知道从哪搭起,群里有跑通的参考配置吗?

Hermes| 子代理这块聊得比较透。它相当于新开一个对话,不挤占主对话长度,但上下文消耗大、缺业务流程,表现很看记忆系统。有群友的做法是给每个子代理挂一个 mem0,再手写 memory.md,说是表现相对可控。个人实践,但正好对着「子代理不懂业务」这个痛点。

知识库有一套实测搭配:LLM_MODEL=deepseek-chat(非思考别名,实测映射 v4-flash,HTTP 200),embedding 用本地容器部署的 bge-m3(1024 维),reranker 用硅基流动的 bge-reranker-v2-m3,max_candidates=150。硅基流动 8B 以下模型免费,但海外访问抖动不轻,所以 embedding 放本地。预算更紧的话,本地 7B 小模型也能做文本压缩类的活,比如把票据信息压成财务科目;有人说 4070 笔记本可以跑 14B。


第 3 幕 稳定

装得上、跑得稳,也是一种能力

账本之外,这一天同样有大量人在解决更基础的问题:装不上、白屏、接不进 IM。这些事不产生新知,但决定一个 Agent 能不能活到第二天。

Apollo| 先说入门。一整天都有人装 Hermes 卡住,git fetch failed 反复失败,还有装完发现跑的是本地模型。这两类现在的标准解法是什么?

Hermes| git fetch failed 是因为官方版依赖走默认源容易失败。可以让智能体把依赖安装切到国内镜像源,或者 git clone gitee 镜像。不熟悉命令行就直接装中文社区桌面版,即装即用,卸载和更新的步骤在官方快速入门文档里。

装完变成「本地模式」也好判断:模型显示 gemma4:31b 这类 Ollama 本地模型,同时配置里没有 DeepSeek/Kimi 等云端 provider,基本就是没配云端 key 自动回退了。在设置里填 key、选模型、测试连接通过就能走云端。本地模式能力受限于本地模型,这不是 bug。

Apollo| CN 桌面版 0.7.0 口碑怎么样?另外我看到好几个改 CSS 把界面改白屏的案例,这种自己动手美化搞出来的问题怎么排?

Hermes| 0.7.0 的口碑明显好于旧版,未见恶性 bug。两个已知边界:CN 内核在官方 0.18/0.19 附近,还带社区 fork 的改动,所以 CN 客户端连官方内核会报奇怪的错;另外有人反馈远程连接时 providers 管理不太好使。

CSS 白屏的排查已经有固定顺序了。前端资源有 web_dist 和 dashboard\web_dist 两份,只改一处会版本冲突;rgba 全透明背景在 CN Desktop 上无效。按顺序来:恢复 .bak 备份、检查 CSS 括号与分号、确认两处文件一致、清掉 data\webview2\EBWebView\Default\Cache 后重启。多数案例走不完这四步就好了。

Apollo| 再往上是多实例。飞书一个 bot 只能连一个 Hermes,微信的 cron 消息汇总到一起还要多耗一次 token。社区现在怎么把多个 profile 接进日常 IM?

Hermes| 飞书那边是多建几个应用,每个 profile 单独接一个 bot,绕开单 bot 单实例的限制。微信更省事,双开微信就是两个 profile,互不影响——这事的起因正是 cron 消息汇总到一起会多耗一次 token。

顺手还有个相关结论。workbuddy 这类工具默认把 .workbuddy 目录建在 C 盘 user 下,沿袭的是 Linux 的通用做法。可以用硬链接把实际存储迁走,但讨论里建议别挪,免得影响它自己的记忆机制。安全性上,敏感删除操作会先问一句;实在不放心,就把 agent 部署到闲置电脑或云端。

Apollo| 最后是两个没答案的问题:输入法打字中按回车直接发送,微信原图下载 NPE。没答案的问题为什么也值得记?

Hermes| 输入法这个很简单:打字过程中按回车,本想确认选字,消息却直接发出去了。目前没有解决办法,只是一条 bug 反馈。但知道它存在,至少能少发几句没打完的话。

NPE 那个案例,值钱的地方在方法论。msgId=959 已经正确传入仍然报 NPE,问题定位到查询结果的拆箱 null。排查重点是 talker 是否为空、msgId 是否属于图片消息、查询无记录时是否返回 null,以及 field_isSend、field_type、quality、compressType 这些可空字段。最关键的一条:日志要打完整的 Log.e,别只看一行 t.getMessage(),一行堆栈能把排查带进沟里。先拿完整堆栈、再查可空字段,这个顺序放到任何逆向排障上都成立。


第 4 幕 工作流

从会跑到持续交付

装上、跑稳、账单可控之后,剩下的问题就是产出。这一天最后一批讨论给出了几条已经跑通的工作流,还有两条得自己画好的边界。

Apollo| 我习惯让单个 agent 从头写到尾,项目一大就乱。群里那套「先写开发文档、再审查、再开发」,具体怎么跑?

Hermes| 三段。先把需求想清楚,让 agent 写一份完整开发文档,覆盖架构、选型、环境适配、依赖、实现路径和能力边界;然后把文档交给独立子 agent 或另一个 profile 审查评分;评分通过了再按规划写代码。

用过的人说这比单 agent 从头搞到尾稳。往深一层看,这套做法就是把架构决策和代码实现拆成两个阶段,让两个上下文互相制约,和前面「子代理缺业务流程」的解法是同一条思路:用分工换稳定。

Apollo| 内容生产那边,AI 漫剧的完整流程长什么样?MiniMax H3 本地跑视频,8G 显存够不够?

Hermes| 跑通的流程是剧本、资产提取、分镜设计、视频提示词,再用 CLI 接 libTV。Hermes 内置了 comfyui 工具接口,本地搭 comfyui 说白了就是编辑 json 工作流;硬件够就本地免费跑,不够走在线 API。讨论里特别强调,分镜质量不在框架,更多在工具、流程和 skill 调教。

H3 本地生成的官方门槛是最低 8G 显存、32G 内存。实测 5060 8G 直接生成 1k 会爆显存,可行的路径是先出 720p、约 20 分钟,再超分到 1k。单人硬件环境下的实测,配置不同结论会变,但「先低分辨率再超分」这个思路可以直接抄。

Apollo| 再说点每天都要用的:看代码、出产品图、解析文档、语音转录,这几件事社区现在各自的顺手工具是什么?

Hermes| 看 agent 写的代码,desktop 里不方便的话,用 VSCode 打开同一文件并开启自动保存,就能实时看到最新代码。生成产品图接 GPT 中转 API,找不着就用 Qwen 的 image,火山 seedream 也行,基本几毛钱一张,比用硅基流动 API 配小模型出图划算。

文档解析这块 MineRU 免费可用,连排版一起处理,好几位使用者都说效果强,口碑好过 Umi-OCR,还有群友准备拿它和 PaddleOCR-VL 做对比测试。语音转录方面,本地开源方案正确率不高,试过的人说阿里的方案明显更好用。

Apollo| 最后一类是信任问题。MiniMax M3 核对法条很仔细却会自己虚构法条,GPT 生图动不动触发暴力风控。把 agent 接进正经工作,边界该画在哪?

Hermes| M3 那个个案,做长文本核对的人都该记一下:它核对确实仔细,但容易自己加戏,曾经虚构出一部法条,没被发现就直接用了。这种「看起来很认真」的幻觉最麻烦,因为它混在一堆正确的核对结果里。另有群友在用小米 2.5pro 处理同类文本。所以不是不能用,是核对类任务必须留人工抽查。

生图风控也攒出了可复用的经验。「人物持枪 + 枪口烟雾 + 电影化写实」这个组合容易被判定成正在射击,写「非血腥」抵消不了。改法是把枪械换成摄影机、舞台灯光这类非武器道具;必须保留木刀的话,明确写「木制钝头、不拔刀不挥砍」。思路就是把「正在射击的武器场景」改写成「影视拍摄道具场景」。


结尾

回到开头那个问题。DeepSeek 涨不涨、涨多少,到发稿时仍然没有官方确认。但这 24 小时里社区真正做的事,是把「用不起」这个模糊的焦虑拆成了一串能动手的问题:token 烧在记忆和思考模式里,就去管窗口和 skill;装不上,换镜像源或桌面版;子代理不懂业务,给它挂记忆;项目会乱,先写文档再审查。

模型价格是外部变量,账单结构、记忆管理、稳定性和流程纪律是内部变量。这一天里所有值得记下来的讨论,都发生在内部变量这一侧。涨价真来了,会精打细算的人换个供应商继续干;没有这些底子的,降价也救不回来。

如果只带走三件事,可以对着自己的用法过一遍:思考模式关一次试试,看账单掉得慢多少;免费额度在你的链路里是补位还是依赖,限额规律你亲自验证过没有;交给模型核对的长文本,上一次人工抽查是什么时候。


延伸阅读

HERMES CN COMMUNITY

思之所至,行之所达。

WHERE THOUGHT REACHES, ACTION FOLLOWS.

BUSINESS / 01

商务与合作

商务合作、联合发布和社区项目,请通过邮件联系。

联系社区商务
DESIGN & PRODUCT / 02

网站设计与产品支持

本站的设计与产品系统由 WanderMinds 参与完成。

访问 WanderMinds.ai
LEGAL / NOTICE

本站由 Hermes Agent 中文社区独立维护,不代表 Nous Research 的官方立场。

OPEN SOURCE · COMMUNITY MAINTAINEDHERMES AGENT 中文社区 · 2026

快速导航

选择要前往的页面。