可复制流程:意图指纹、三级记忆与 Query 前置处理
把系统从「能用」升级到「可维护、可进化」:区分意图指纹与高频缓存,把三级记忆插进流程,串成完整的 Query → LLM 前置处理链路。
聚焦 AI Agent 全链路工程实践:RAG 检索、记忆系统、Agent 编排、Next.js 产品落地与 AI 协作工程化。下方为当前写作方向;首页文章列表仅展示本阶段内容。
把系统从「能用」升级到「可维护、可进化」:区分意图指纹与高频缓存,把三级记忆插进流程,串成完整的 Query → LLM 前置处理链路。
意图识别要分层:高频走正则,常规走小模型,低置信才 LLM 兜底。路由再叠加置信度阈值与成本感知,避免动不动就上 RAG。
上下文不只是 messages。本文先串 DeepSeek 级「Query → 回复」全链路,再降维成中小企业可落地的「意图 → 路由 → 拼装 → 生成」五步流水线。
感悟:Prompt 特别像新人的岗前培训——你是谁、要干嘛、怎么干;情绪要饱满;给话术和例子;红线不能碰。
解码策略决定「下一个词怎么从概率分布里挑出来」。面试常考:Top-k 与 Top-p 的本质区别,以及温度 T 与采样的关系。
生成一开始只有 <Start>。第一个词来自:交叉注意力从 Encoder Memory 抽语义 → 线性投影到词表 → Softmax 取最高概率。
自注意力让序列里每个词并行与全文算关联度;相关性越高,权重越大——这是 Transformer 捕捉长距离依赖的核心。
Transformer 基于自注意力、舍弃循环结构;Attention 本质是 Q(新来的)点积 K(历史),得到权重后加权求和 V。