反代通道裁掉记忆注入后 Agent 忘了自己是谁
一场反代失忆事故牵出当天的主线:记忆没丢,是通道没注入。社区顺着它讨论了遗忘曲线怎么设计、/new 清理上下文的土办法,以及 v4flash 返工率吃掉价格优势的账——免费的额度,往往以另一种方式收费。
发布日期:2026-08-11
过去 24 小时,社区里最热的一条线索不是新模型,而是一场失忆:换了免费反代通道的 Agent 忘了自己是谁。顺着这场事故往下追,记忆为什么难、免费额度为什么并不便宜,其实是同一个问题。
下面是这一天的对谈。Apollo 已经把 Agent 接进日常工作的实践者,正在权衡免费通道和付费主力链路的取舍,提问直接、追边界,不接受笼统答案。Hermes 长期观察社区的科技媒体主编,回答先落到过去 24 小时群聊里的事实和案例,再做有证据边界的机制解释与克制归纳。
第 1 幕 失忆
换了个免费通道, Agent 忘了自己是谁
下午开始的几个小时里,社区多个群几乎同时在排查同一件事:经 9Router 反代使用 WorkBuddy 的 v4flash 之后,Agent 关窗重开就变成了「刚初始化的 Hermes agent」。
Apollo| 昨天好几个群都在说 Agent 突然失忆,连身份都忘了。这是模型变傻了,还是哪个环节出问题了?
Hermes| 症状很明确:经 9Router 反代用 WorkBuddy 的 v4flash 时,关掉窗口重开,Agent 就忘了自己是谁,自称刚初始化的 Hermes agent;给它重新定义身份,当前会话有效,再开新会话又忘。有群友的飞书会话记忆正常,但 CLI 会话同样失忆。
关键对照是:同一个模型走 Go 版和商汤通道都正常,问题只出在 WorkBuddy 这一路。所以讨论很快排除了「模型变傻」,把疑点锁定在通道上。
Apollo| 既然是通道的问题,具体是丢了什么?记忆数据还在不在?
Hermes| 讨论的判断是:记忆数据还在,只是新会话的第一句没有注入长期记忆——称呼、偏好、身份这些本该开场就带进上下文的东西没来,Agent 自然「不记得自己是谁」。有群友的 Agent 自己给出的解释也指向同一点:反代不过 gateway,就没有加载 memory provider。
类似现象不止这一处,其他反代项目的 issue 评论里也有人提到(github.com/xiaoY233/Chat2API 的 issue 178)。这个问题当天下午出现、当晚已恢复,但它暴露的不是一次故障,而是反代通道可以在你看不见的地方裁掉功能。
Apollo| 当晚就恢复了,那这事是不是翻篇就行?对还在用各类免费反代的人,有什么值得记住的?
Hermes| 恢复不代表可以翻篇。当天的排查过程本身是个示范:先用「同模型换通道是否正常」做隔离,再区分「记忆丢失」和「记忆没注入」——前者是数据问题,后者是链路问题,修法完全不同。
对实践者更有用的信号是:新会话不带上下文是正常的,但不带你的身份和偏好绝对不正常。用这个标准,失忆这类问题几分钟就能定位到通道层,而不必怀疑自己的记忆系统配置。这还不是一个已坐实的普遍问题,但它是当天多个群交叉验证过的真实案例。
第 2 幕 记忆
记忆系统这么热, 为什么没人给出标准答案
失忆事故只是引子。过去 24 小时里,记忆系统设计本身就是社区最密集的话题——从遗忘算法到 KV 缓存,从外置记忆库到土办法,各群都在谈,但谈法完全不同。
Apollo| 记忆系统讨论了一天,我看到的全是方案之争。技术上的难点到底卡在哪,为什么连「怎么遗忘」都要自己设计?
Hermes| 当天的一个设计讨论给出了具代表性的方案:按热度轴和时间轴做遗忘,记忆抽屉化分热度、常温、冷藏三层,近期、中期、远期双轨制,配合压缩去噪、去重、蒸馏合并实现自动化。另一种观点把记忆类比多层 CNN——越浅层越具体、越深层越抽象,AI 从深往浅读,够用就不再往上查;对多层压缩后的逆向解码问题,讨论提到了 autoencoder。
更硬的约束在工程侧:向量检索经常返回错误内容、还有语义断裂;想让插入记忆的上下文保持干净,就得反复从头计算 KV 缓存,难点是费 token。讨论里另一条路是训练能处理记忆标签的模型,可以持续插入而不必重算——那已经是模型层的事,不是配置能解决的。
Apollo| 理论方案离我有点远。不想自建记忆系统的人,当天有没有能直接抄的做法?
Hermes| 有,而且出奇地朴素。一种做法是把一个会话固定成一种类型、只负责该类事务,记忆做指针可跳转;另一种是按需引入内容,处理完任务就 /new 清一次上下文,避免记忆混杂。讨论里有句话值得记住:一直滚动更新的知识记忆等于没有记忆。
还有一个针对「模型认错后屡教不改」的土办法:让它写深刻检讨存进 md 文件,并检查有没有把这条写进 soul.md。这些做法的共同点是承认记忆系统不完美,用流程和文件把最重要的东西钉死,而不是指望检索永远召回对的内容。
Apollo| 那外置记忆系统呢?腾讯云刚出的 TencentDB-Agent-Memory 被推荐了,值不值得迁移过去?
Hermes| 它确实因为「记忆系统容易满」的提问被推荐:腾讯云出品,把对话、文档和代码转成 Chat Memory、Skill、LLM-Wiki、Code-Graph 四类可复用的记忆资产,可跨 agent 和框架治理共享。
但另一个群的讨论泼了冷水,认为它更像 CTX 压缩器、不如 hindsight,噱头偏大。当天的实际情况是:用 hy 的群友建议直接开 Ultra 模式——官方所说开 Pro 够用被讨论认为不够,免费方案可以在硅基流动配免费的 LLM 和 Embedding 模型,再在此基础慢慢定制。选记忆系统这件事,社区当天没有共识,只有「别指望开箱即用」这一条一致意见。
第 3 幕 账单
免费额度的账, 要连返工率一起算
失忆和不稳定的背后是同一条经济逻辑。这一天社区同时在算另一笔账:免费和低价模型到底省不省钱。
Apollo| v4flash 输入 2 元输出 4 元,看着很便宜,为什么群里有人说它实际并不便宜?
Hermes| 因为单价只是账面的一半。反馈称 v4 系列返工率高、输出 token 数倍于 gpt,实际并不便宜;相比之下 gpt 和 claude 返工率较低。另有缓存命中价格将涨十倍的传言,群内未能证实,能确认的只是充值目前仍划算、马上涨价。
同一天还有一条对照新闻:OpenAI 官方推文称已为所有 ChatGPT Work 和 Codex 付费用户重置使用额度,重置前有群友反馈额度异常消耗、个例从 80% 直接掉到 0,官方暂未说明后续重置周期。一边按返工率悄悄收费,一边直接重置额度,两种定价哲学摆在了同一天。
Apollo| 那免费额度到底该怎么用?OpenClaw 免费版 3 分钟超时这种,是不是等于没法用?
Hermes| 有群友的原话是「OC 5分钟,超时3分钟,没得用」——让它分析日志的任务跑不完。对长任务来说,这确实等于没法用;但把免费额度一棍子打死也不符合当天的讨论。
社区的用法是按场景分层:没有上下文要求的场景,可以用 OpenCode 和 CodeBuddy CN 的 ds4flash、zen 每日 200 次的免费额度;Luna 按 2x 计费后,有群友因此改用 zen 免费的 d4flash free;千问办公模式注册送 2000 积分、workbuddy 免费活动续到月底,做项目初步开发够用。免费额度适合一次性的粗活,主力链路——尤其是要带记忆、跑长任务的——得为稳定性付费。
结尾
回到开头的问题:免费通道把 Agent 的门槛打到接近零之后,剩下的是什么?过去 24 小时给出了三个切面——反代通道悄悄裁掉记忆注入,让 Agent 当场失忆;记忆系统本身仍是各家自己摸索的无人区,从抽屉化遗忘到 /new 清理,没有标准答案;低价模型的单价优势,被返工率和超时一点点吃回去。
这三件事是同一件事:模型能力和接入成本都在快速下降,区分「能跑起来」和「能长期替你干活」的,变成了记忆、通道和稳定性这些不那么性感的层。选通道时多问一句它裁掉了什么,选模型时把返工率算进单价——这是这一天社区用真实故障换来的经验。
延伸阅读
- CHAT2API ISSUE 178(反代失忆的类似反馈):https://github.com/xiaoY233/Chat2API/issues/178
- TENCENTDB-AGENT-MEMORY:https://github.com/TencentCloud/TencentDB-Agent-Memory
- OPENAI 额度重置官方推文:https://x.com/thsottiaux/status/2086188036493344823