做 AI 编程助手开发的人,最近可能都有一个共同烦恼:上下文窗口越来越大,但模型反而越来越"笨"。

这不是错觉。随着 Gemini、Claude、Codex 这些模型把上下文窗口卷到 100 万甚至更多 tokens,开发者发现一个反直觉的现象——塞进去的内容越多,模型在关键决策上的注意力越分散,推理质量开始下降,更重要的是,每一轮对话的 token 成本直线飙升。

更麻烦的是,当你切换工具、换个模型,或者执行一次 /clear 清空上下文,前几轮定下的架构决策、参数调优记录、用户约束条件,瞬间蒸发。下一次对话,AI 又是一张白纸。

Engrim 想解决的就是这个问题。它把自己定位成"AI 内存的中立国"——一个本地优先、绑定项目的 SQLite 记忆引擎。

核心思路相当硬核:与其在 200K tokens 的噪声里捞针,不如把项目里真正重要的决策,提炼成 4,000 字符左右的"策展级"工作记忆。模型可以随时换,Antigravity、Claude Code、Cursor、Windsurf 都可以,但项目记忆留在你自己的机器上,谁也拿不走。

技术栈选得很务实:底层是 SQLite FTS5 做 BM25 关键词检索,搭配静态向量嵌入(model2vec),用 Reciprocal Rank Fusion 做混合排序,零延迟、纯本地、零云依赖。它通过 MCP 协议接入各个 AI CLI,相当于给每个工具外挂了一个共享记忆层。

最有说服力的是作者的实战数据:在一个 5 万行的算法交易系统上跑了 105 个连续会话,累计消耗 15.3 万 tokens 的工作内容,最终压缩到不到 1,000 tokens 的活跃记忆包——上下文重启成本砍掉 99% 以上,186 个单元测试零回归,跨模型切换零架构漂移。这种数字放在真实跑资金的项目里,挺能说明问题的。

工作流也设计得很自然:边干边存,结束前打个 resume-pointer 标签,下次启动时这条记录会被 pin 在 [▶ RESUME HERE] 位置;想清上下文就放心清,记忆包会自动重新注入。

我的判断是:这类工具的出现,本质上是在承认一个事实——大模型本身越来越像"一次性水电",项目上下文才是真正的资产。当 AI 编程工具从"玩具"走向"生产环境",如何管理跨工具、跨模型、跨会话的项目记忆,会成为一个越来越基础的问题。Engrim 给出的解法足够轻量,值得每个重度 AI 编程用户关注一下。


来源:Hacker News