Home avatar

JoeSmile

聚焦 AI Agent 全链路工程实践:RAG 检索、记忆系统、Agent 编排、Next.js 产品落地与 AI 协作工程化。下方为当前写作方向;首页文章列表仅展示本阶段内容。

当前方向

历史归档

2018–2019 年前端与 Node.js 学习笔记(Koa、JavaScript、MongoDB 等)已整理为归档,URL 保持不变,可随时查阅。

从本地到生产:RAG 系统多层缓存架构的演进之路

一套能扛住高并发的语义缓存,是怎么从「玩具」一步步长成「企业级」的。


一、为什么 RAG 系统需要多层缓存?

RAG 系统的响应链路通常是:Query →(可选)向量检索 → Agent / LLM 推理 → 生成答案。这一过程少则 2~3 秒,多则 5~10 秒,且每次调用都伴随着 Token 成本。