
图片由 AI 生成
你大概也遇到过这样的场景。跟客服机器人讲了大半天自己的个人信息、诉求、喜好,聊了好几轮,过会儿再次打开对话框,它会客气的问候:“ 请问有什么可以帮到你?”
如果换个模型、换个 Agent,再一股脑提交上数十页的文档素材,无论反复输入怎样的提示词,你会发现,AI 输出的可能只有开头和结尾的内容,对于中间说了什么,它其实并不记得。
AI 很聪明,但忘性也很大。这并非是你的错觉,而是当下大模型“ 无状态交互” 的结构性缺陷,每次对话结束后,所有历史信息都会被丢弃。
这种健忘带来的远不止体验层面的割裂。放在企业级,用户不得不通过重复输入历史对话来维持上下文连贯,Token 消耗居高不下、计算负荷激增,大量无效资源被浪费在低质量的沟通中。
当 AI 产业开始告别单纯参数堆砌与算力军备时,大模型的记忆,不在于知道更多,而在于如何有效地记住和理解,这个更本质的课题开始得到业内关注。
这也是红熊 AI 已坚持了两年的答案。
AI 越聪明,就越健忘?
说到底,跟幻觉一样,记忆同样是大模型的天生缺陷。这源自多重技术局限的叠加:模型固有的上下文窗口限制与注意力衰减,导致长对话中的早期关键信息被遗忘;相似信息区分能力弱、冲突信息带来的逻辑错乱,则会让模型只能给出模棱两可或错误的回复。
早期的向量数据库、RAG 检索增强生成,相当于外挂记忆产品—— 本质上只是简单存储聊天记录,任务触发时检索文本投喂模型,无法实现自主记忆管理。它们并不是真正的长上下文,更谈不上“ 记住”。
2024 年 9 月,红熊 AI 在 AI 客服营销场景的落地时注意到,当客户进行后续咨询时,AI 对上一次交互没有任何记忆。客户必须重新解释问题、提供账户信息、说明背景,每一次都是如此。这种情况严重制约了个性化服务场景的业务准确率。
最初,团队尝试了市面上所有主流方案,包括大模型微调、知识库增强、Agent 框架搭建,一番折腾后,准确率从 30% 勉强提高到 70%。但一个 70 分准确率的产品,在红熊 AI 创始人兼 CEO 温德亮看来远未达到及格线。
那段时间,温德亮带着核心团队翻遍海量学术论文,尝试了多种方案后,最终发现:问题的核心可能不在模型智能本身,而在于记忆的缺失。大模型固有的“ 近因效应”,才是幻觉和业务断层的根源。或许基于“ 类人脑记忆” 驱动推理的方式,用记忆来约束用户的提问上下文,可以大幅提升模型回复的准确率。
团队随后通过设计动态记忆锚点,将用户每一次提问都纳入上下文约束,模型的回复始终沿着记忆推导。多轮尝试下来,业务准确率也确实从 70% 一路提升至 90%,最终稳定在 98% 以上。
这次成功的项目经验彻底扭转了红熊 AI 的创业方向,他们开始锁定“ 记忆” 赛道,随后迅速获得了 500 多家企业客户的认可,短期内即实现净利润。近日,红熊 AI 宣布完成数亿元 A+轮融资,投后估值达 30 亿元。
目前红熊 AI 以 91.54% 和 95.0% 的成绩,分别登顶全球两大长期记忆权威评测榜单 LoCoMo、LongMemEval,其记忆能力不仅在产业侧得到验证,也在学术界获得最高认可。

LoCoMo 测评结果


LongMenEval 测评结果
从单点到全栈,把记忆做成基础设施
“ 很多企业路径可能偏了。AI 记忆机制的搭建应该产生于与人的持续交互中,而不是单纯的靠预训练或数据的单向灌输。”
温德亮认为,AI 正朝着“ 人” 的方向进化,并将演深到记忆、认知乃至脑科学层面。如何让 AI 更符合第一性原理,像人一样学习和成长。在这一进程中,记忆正成为下一代 AI 的核心基础设施。
这一路线的核心,是将记忆机制深度融合于大模型底层架构。在技术实现上,红熊 AI 构建了分层记忆体系 MemoryBear(记忆熊):借鉴人类大脑的认知机制,区分“ 瞬时记忆— 工作记忆— 长期/永久记忆” 存储体系,并引入智能管理机制与自我反思引擎,模拟人类记忆的巩固与遗忘过程。同时还内置两大仿生机制:自动遗忘机制+3D 反思机制,自主清理错误、过时信息,实现 AI“ 选择性记忆”,交互越久,识别有效信息的能力越强。
其完整记忆处理流程分为三步:1、萃取:从海量对话交互中筛选、提取高价值情境事实,过滤无效冗余内容;2、关联:依托知识图谱存储,搭建不同场景、不同用户记忆点的网状关联关系;3、匹配:混合检索机制,快速匹配当前任务所需历史记忆,精准调用关键信息。
在 Agent 从“ 问答工具” 走向“ 可交付结果的智能伙伴” 的进程中,记忆正从边缘能力升级为核心基础设施。红熊 AI 的业务场景延伸,也印证了这一趋势。在产品架构上,红熊 AI 先后搭建出了面向智能客服、智能营销、ChatBI、企业培训等场景的 Agent 应用,从最初的客服场景起步,到覆盖售前、售中、售后的客服营销,再到数据分析 ChatBI 和企业员工培训场景,每一个场景的延伸,都源自客户的真实需求。
红熊 AI 还自研了 OpenBear(通用全模态大模型) 和 CodeBear(记忆型编程大模型)。前者扮演了 AI 操作员的角色,有点类似于当下的 Workbuddy,是 AI 超级员工的入口;而后者则希望解决工程化开发任务重的核心难点:如任务中断、任务项目背景、项目方式发生极大变化等,都会因记忆续不上导致工程代码的偏差。
对于红熊 AI 而言,这两款模型的研发虽暂时不见得有很高的市场预期,但已经变成他们现阶段必须要做的事情。温德亮认为,B 端客户其实不在于软件企业使用哪个模型,他们更关心能否解决核心问题。以客服场景为例,客服是个典型的有高并发的场景,当业务量激增时,一旦上游的模型厂商无法及时响应并发需求,就会导致软件企业无法实现弹性扩容,进而影响下游的客户体验,“ 这种需求时长得不到满足,是我们被迫自研的根源。”
记忆如何改变 Agent 时代规则
年初以来,业内已频繁提及“ 记忆” 并逐渐认可其价值,但在更广泛的行业和企业场景中,客户对如何真正落地记忆、将其与自身业务结合,仍缺乏清晰的参考路径。
温德亮告诉我们,客户在实际落地中面临的挑战非常具体:行业专属的数据 Know-how、差异化的业务流程、各有侧重的客户话术体系,如何将这些转化为经验、沉淀为知识,进而让模型有效理解,中间还涉及模型迭代对既有知识的稀释问题,技术难点层出不穷。
与此同时,很多客户仍习惯用传统软件的标准来衡量 AI 成效,如业务精准度、AI 问题解决率、业务转化率等指标,仍是传统的业务维度。而记忆的最终价值,依然要落到更实际的业务结果上,如缩短执行时间、提升精准度、优化用户满意度。
对客户而言,落地 AI 往往需要梳理业务流程、开展数据治理、明确定义交付结果。比如模型“ 偏好” 的数据与业务系统实际提供的数据往往并不一致,且每家企业情况不同。
此外,记忆机制虽能有效降低 Token 消耗,却在推理时会带来时延。在保证准确率的前提下,延迟会从 800 毫秒增加至约 1.8 秒,这是红熊 AI 当前能达到的最优水平。但关键在于,客户应拥有选择权:是希望响应更快但准确率略低,还是接受稍慢但更精准的结果,这都由客户根据场景自主决定。
当被问及红熊 AI 的壁垒,温德亮表示,AI 原生软件与过去的软件其实存在本质区别。传统软件采用硬编码,业务逻辑被代码写死,跨行业复用度低,基本依赖定制开发。而 AI 原生应用由 Agent 驱动,跨行业只需调整参数和工作流,无需改变核心业务逻辑和产品适配性。记忆产品的设计也基于此逻辑,让 Agent 在恰当的时机调取恰当的历史信息。
大洋彼岸,近期与红熊 AI 同期获得融资的初创公司 Engram,仅凭借“ 记忆” 概念便拿到近 1 亿美元。两笔融资释放出一个强烈信号:当 AI 具备了接近人类的记忆能力时,那些仍依赖上下文窗口或 RAG 处理长内容的模型机制,将面临深刻冲击。
因为客户的选择已经表明,他们不需要模型机械地死记硬背,也不愿通过消耗大量 Token 来换取所谓的效率提升。过去我们常讲的降本增效,到今天已不能简单等同于产生业务价值,Token 推理不存在边际成本递减,反而可能随业务增长而逐步上升。这份不确定的成本账单,已经在迫使企业精算投入产出。在成本与效率之外,由记忆驱动的推理准确性的提升,才是真正能够带来业务价值的关键。
记忆早已不再只是技术概念,而是经过产业有效验证、具备实打实商业价值的落地能力。以记忆为驱动的 Agent,正逐步走向日常应用。
7 月 31 日 18:00,红熊 AI“ 记忆觉醒 · 智能新生” 线上产品发布会将正式启幕,不仅 MemoryBear 记忆引擎迎来重磅升级,还将发布红熊 AI 自研的 OpenBear 、 CodeBear 两款记忆型大模型,以及基于原生记忆底座的 AI 客服、AI 营销、ChatBI、AI 教育四大场景化 Agent 应用。
欢迎关注并观看直播,见证记忆如何重构 AI。(本文首发于钛媒体 APP,作者 | 杨丽,编辑|盖虹达)
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App














