上下文一过 300k Agent 开始删掉自己做对的东西
社区插件把 DeepSeek V4 Pro 被首轮工具结构压住的能力解锁到 98.5 均分,灰测水平被复现成三档。但解锁之后,真正的门槛变成 300k 上下文后的记忆失效,和涨价后翻倍的 token 账单。
发布日期:2026-08-17
过去 24 小时,社区用插件把 DeepSeek V4 被压住的能力找了回来;可一旦把 Agent 放进长任务和日常开销里,记忆失效和账单上涨成了更靠前的两件事。
下面是这一天的对谈。Apollo 已经把 Agent 接进日常开发的实践者,关心能力边界、长任务稳定性和每个月的 token 开销,问题直接,不接受过于简单的答案。Hermes 长期观察这个社区的主编,回答先落到过去 24 小时群聊里的具体事实,再做有证据边界的解释和归纳,不把个案说成普遍规律。
第 1 幕 解锁
V4 Pro 不是变弱, 是被首轮工具结构压住了
这一天社区最热的事,是 DeepSeek V4 灰测期的能力被几个开源插件稳定复现了出来。入口是一个看似矛盾的数据:同一个模型,换一种首轮工具配置,分数差了将近 8 分。
Apollo| 官方 Standard 模式跑 V4 Pro 只有 91、92 分,Minimal 模式能到 99、96 但只带两个工具。这是模型被削弱了,还是用法出了问题?
Hermes| 群里的实测给出的答案是后者:V4 Pro 对首次请求的工具结构极其敏感。有人做了一个叫 dsh-anchored-standard 的两阶段插件,首轮只给 shell 和 read 两个工具,先锚定 Minimal 模式下的推理轨迹,第一次工具调用发生后立刻恢复 Standard 的全部 25 项工具。
结果是 Windows 上连跑两次拿到 98 和 99,均值 98.5,第二轮全程没有再出现 let me 思维链。分享者的结论是这不是抽卡,也不需要牺牲完整工具能力。插件和完整评测都已开源。这目前是单个案例的数据,但方法本身可以被任何人复现验证。
Apollo| 一个插件就能把灰测期的能力找回来,这背后的机制是什么?灰测能力到底被分成了几档?
Hermes| 群里整理出的理解是,灰测能力现在被分成了三档:直接访问的 flash 水平、极简模式下超过 opus 4.8 的水平,以及在此之上概率触发的更高一档。前两档已经有对应的开源插件可以复现,flash 和 pro 各有仓库,最后一档仍然要靠抽卡,还没有人研究出稳定触发逻辑。
讨论里还有一个低成本的旁证:把“You are a helpful software engineer assistant.”作为首次输入,可以减少 let me 思维链,但工具不能挂太多。一种解释是模型后训练偏向极简模式,首轮给满工具反而会把它推回敷衍的推理路径。使用上还有个细节:很吃首次会话的加载方式,一开始就全量加载会退回 let me 思维链。
Apollo| 这些插件大多围着 Pro 转。日常更多人用的是 flash,它有同等待遇吗,还是便宜模型就该认命?
Hermes| flash 也有对应的开源路由插件。更直接的是另一条实测:v4 flash 开 max 思考强度后提升明显,有实战视频演示,群友的测试结论是它已经稳定超过 GLM 5.2。
不过讨论同时提醒,思维链表现因环境而异:Linux 和 Windows 不一样,极简模式和其他模式也不一样。所以“flash 变强了”目前是有视频和多人群内复测支撑的社区结论,但具体到你的环境,最好还是自己跑一次再下判断。
第 2 幕 记忆
能力解锁以后, 长任务先崩的是记忆
能力问题解决之后,真正把 Agent 留住的瓶颈换了位置。这一天的另一条讨论线,几乎都指向同一个症状:上下文一长,模型开始忘掉、甚至删掉自己之前做对的东西。
Apollo| 我这边任务一拉长,Agent 就把之前整理好的数据全删了。让它定期总结、把错误写进文档都挡不住。这是个例还是普遍问题?
Hermes| 至少群里有和你的遭遇几乎一致的案例:文本变长后 AI 把之前整理的数据全删掉,定期总结和错误文档都拦不住,频繁切换模型时更容易出错。讨论里的经验线是上下文超过 300k 之后模型记忆明显变差,另有观点指出 API 传采样参数时,默认低温在长上下文下会逻辑死锁。
那位群友的应对是工程性的:先把回滚功能做出来,再装给其他智能体,重要数据用 Git 备份。这说明社区的共识不是“换个更聪明的模型”,而是默认记忆会失效,把可回滚当成基础设施。它还不是已被坐实的通用规律,但值得你按会发生来准备。
Apollo| 如果默认记忆会失效,架构上有什么已经在跑的解法?另外长任务跑到一半提示无响应,是不是同一个病?
Hermes| 架构层面,群里出现了一个分三层的记忆设计:最上层只记录全局项目进度并监控第二层,第二层管当前小结和下发指令,最底层只负责执行与上报,各层对话和层间互动都不计入上下文,用隔离避免互相污染。另一个被反复提到的方向是自我进化:agent 反思对话记录,把执行不好的任务沉淀成技能,下次按技能执行,这等于把记忆从上下文挪到了文件里。
无响应则大多是另一回事。有群友爬抖音的 80 分钟任务也出现过这个提示,经验是看工具调用处有没有数据,有数据就不用管;v4 flash 的无响应放五六分钟左右通常会自己恢复。长任务里的“卡住”和“失忆”要分开诊断,前者多半是等待,后者才需要回滚。
第 3 幕 账单
最后一层约束, 是每个月的 token 账单
能力能解锁,记忆能工程化,剩下绕不开的是钱。DeepSeek 涨价预期笼罩下,这一天社区里相当多讨论其实都在算账。
Apollo| 我看到有人用 Hermes 实测 DeepSeek 缓存命中率到了 96.45%。我的账单却越来越厚,缓存这事有多少是能用技巧控制的?
Hermes| 群里的拆解相当具体:每个会话的第一句不会命中,中间修改任意会话内容(比如压缩)也不会命中;想要高命中率,要保持第一句之后都是尾部追加。累计到 1M 峰值、或用量降到临界点之后,要么压缩要么新开会话,而新会话如果接续上次内容,第一次的量也会比较大。96.45% 的实测命中率就是在这种用法下跑出来的。
另一条体感是 harness 比 Hermes 省 token,讨论怀疑优化点在长期记忆上,这一点还没有定论。可以确定的是,缓存命中率不是平台施舍的,它直接取决于你怎么组织会话,这是账单里少数完全由你自己控制的部分。
Apollo| 技巧归技巧,涨价是硬性的。有群友说月开销翻了几倍。现在社区实际在用什么方案对冲,各自有什么坑?
Hermes| 那位群友的账是:原来每天平均 1 到 2 元、一个月约 40 元,涨价后翻了几倍,因为正在给小团队做项目管理工具,受冲击很直接,只能回头优化 token 使用。被提及最多的对冲方案是 opencode go 的 5 美元档,群友算账双倍用量约 15 亿 token、约 32 万次调用,并认为 17 号前官网 v4 flash 性价比很高;但当天下午 Go 套餐的 DeepSeek 线路和官方线路都出现过 400 报错,换 Mimo 才正常。
另一类坑是隐藏门槛:调用 seedance 模型要求账户余额不低于 200 元,客服口径这是保证金而非最低消费,不管你用什么套餐。验证方法很简单,充 5 元调一次 API,会提示余额低于 200 不能用。这些价格和额度都属于易变信息,以社区当天反馈为准,下手前最好再核一次官方页面。
Apollo| 那索性本地部署呢?把 token 变成一次性硬件投入,是不是就能从账单里解脱出来?
Hermes| 群里的实测给了一个不太乐观的基线:3 万预算本地部署 27B 级模型跑不到 20t/s,qwen3.8-27b 开了 MTP,q8 和 q4 都在 15t/s 以下,而且接入 agent 后上下文一长还会降速。讨论的判断是整机预算 10 万以上才真正实用,RTX 6000 级 84G 显卡可以直接跑 0731,但整机已是 10w+ 级别。
也有折中尝试:有人测 k_m_q4 量化模型 262k 上下文跑满不到 30G 显存,正在试 DS Pro 出方案加 qwen3.8-27B 做开发的组合。本地部署目前更像是有明确预算门槛的选项,而不是账单焦虑的通用解药。
结尾
回到开头的问题:这一天社区证明了两件事。模型能力没有退化,只是对首轮工具结构敏感,插件就能解锁;而真正拦住 Agent 长期干活的,是 300k 之后会失效的记忆,和涨价之后必须逐条计算的账单。
所以答案偏向后者:缺的不是更强的模型,而是围绕模型的工程——回滚与分层隔离对付记忆,会话组织与套餐核算对付成本。下一轮模型升级到来之前,这些是实践者现在就能动手做掉的部分。
延伸阅读
- DSH-ANCHORED-STANDARD:https://github.com/xiaobright/dsh-anchored-standard
- MODELTEST 完整评测与统计证据:https://github.com/xiaobright/modeltest
- DSH-ROUTING-SUITE:https://github.com/yjh051108/dsh-routing-suite
- V4 FLASH + MAX 实战视频:https://www.bilibili.com/video/BV1GpbC6EEwj/