大模型应用一站式开发:从需求锚定到运维落地
目录
极客时间《情感陪伴机器人》相关笔记的总览篇:把提示词锚定、需求定义、技术选型、开发集成、评估优化与运维串成一条可落地的链路。
提示词「锚定方向」四大要素
- 目标(Goal):提示词的核心,需明确模型要完成的具体任务,避免模糊表达。例如「写 500 字人工智能医疗诊断应用短文(含优势与挑战)」远优于「写点关于人工智能的内容」,能让模型精准把握任务边界。
- 上下文(Context):提供任务背景与必要外部信息,包括行业背景、使用场景或任务相关材料(如总结文章时,文章本身就是上下文)。同时需要明确区分指令与上下文,避免「提示词注入」,帮助模型理解需求关联性。
- 期望(Expectation):定义响应的格式、风格与受众,如「以项目符号呈现」「用正式商业语气」「面向 10 岁儿童解释」,或代码生成时指定语言与输入输出需求,减小后续调整成本。
- 来源(Source):指定模型生成响应需参考的数据源(如指定文档、财报、数据集链接),适用于需领域知识或实时信息的任务;若模型已具备所需信息,此要素可省略。
无论采用何种框架,核心思想一致——通过「清晰目标 + 充分上下文 + 明确期望 + 精准来源(按需)」,为模型提供完整「执行指南」。避免冗余信息,同时确保关键信息不缺失,才能最大化降低理解偏差。
简易流程
- 用户提问
- LLM 分析问题是否需要 RAG
- 如果不需要 RAG,直接使用 LLM 生成答案
- 如果需要 RAG,通过互联网、向量数据库、文件等数据源获取相关知识
- 过滤、排序后形成 prompt context,再送给 LLM 总结生成答案
- 将答案返回
需求定义
1. 核心目标:锚定「做什么」和「为什么做」
- 「为什么做」:定义项目的价值原点
- 「做什么」:定义项目的边界范围
2. 关键问题拆解:让需求从「模糊」到「具体」
业务痛点:挖掘「可量化的具体瓶颈」。分析时可遵循「场景 → 行为 → 痛点 → 影响」的逻辑链。
目标用户:区分「直接用户」与「关联角色」。
| 用户类型 | 核心诉求 | 影响需求设计的关键因素 |
|---|---|---|
| 直接用户 | 客服人员:快速响应咨询,减少重复操作 | 功能需适配客服现有工作流,学习成本低 |
| 间接用户 / 决策层 | 客服主管:实时查看咨询解决率、人力节省数据 | 需提供数据仪表盘,支持多维度统计分析 |
| 最终用户 | 消费者:快速获取准确答案,无需等待人工 | 自动回复需简洁易懂,支持「转人工」入口 |
感悟:流程都要被「看见」——无论是好是坏、被攻击还是出错,都要被衡量。之后拿这些数据改进系统。如果可能,转人工,人工兜底。
3. 核心指标:设定「可验证的量化标准」
例如自动回复场景:
| 指标名称 | 目标值 | 计算方式 | 数据来源 |
|---|---|---|---|
| 自动回复准确率 | >= 92% | 正确回复数 / 总自动回复数(人工抽样验证) | 客服系统对话日志 |
| 人工转接率 | <= 8% | 转人工对话数 / 总自动回复对话数 | 客服系统工单记录 |
| 平均响应时长 | <= 3 秒 | 自动回复发出时间 − 用户提问时间(取平均值) | 对话时序数据 |
4. 技术必要性:判断「是否真的需要大模型」
- 第一层:能否用规则引擎解决?固定格式识别(订单号、手机号)、明确关键词匹配,用 if-else / 正则即可。
- 第二层:能否用简单机器学习模型解决?单一分类、结构化数据预测,逻辑回归 / 随机森林往往够用且更便宜。
- 第三层:是否必须用大模型?仅当涉及复杂语义理解、开放领域生成、跨模态处理时,大模型才有不可替代性。
落地方法论:从「需求」到「可执行任务」
明确关键问题后,通过场景拆解与可行性评估,将需求转化为可落地、可验证的子任务。
一、场景拆解:化繁为简
按「独立可执行」「独立可验证」拆分子场景:
- 按「用户旅程」拆分核心环节(如:提问 → 意图识别 → 自动回复 / 转人工 → 跟进)
- 提取可落地子场景(如意图识别、常见问题自动生成答案)
- 明确每个子场景的「最小闭环」:
| 环节 | 举例 |
|---|---|
| 输入 | 用户咨询文本,如「我的快递到哪里了」 |
| 处理 | 大模型匹配知识库物流查询话术 |
| 输出 | 引导用户提供订单号 |
| 验证 | 自动回复引导成功 |
二、可行性评估:预判风险
按「技术、数据、成本」三维度评估:
| 评估维度 | 核心评估问题 | 风险提示点 | 应对方案 |
|---|---|---|---|
| 技术可行性 | 现有技术能否支撑?部署环境是否匹配? | 需处理多语言,但模型多语言能力弱 | 换多语言模型,或补充小语种微调 |
| 数据可行性 | 是否有足够高质量数据? | 缺乏「售后争议类」对话数据 | 采集人工对话;用合成数据补齐 |
| 成本预算 | 研发运维是否在预算内?ROI 是否合理? | 算力成本超预算 | 压缩量化;非高峰离线处理 |
实践原则:小场景切入,快速验证价值
遵循「小场景、高价值」:
- 如何选小场景:优先「高频、低复杂度、数据易获取」——如客服「物流查询」占比高、单轮可解、已有历史对话。
- 如何验证高价值:落地后看人工转接率、日均处理量等业务指标是否改善。
- 迭代扩展:常见问题自动回复 → 多轮咨询 → 跨渠道整合,形成「验证 → 优化 → 扩展」螺旋。
技术选型
1. 模型选择
| 约束 | 倾向 | 优点 | 缺点 | 适合 |
|---|---|---|---|---|
| 数据敏感 | 开源本地部署 | 私有、成本可控 | 需自行优化 | 内网 / 合规场景 |
| 周期短 | 厂商 API | 成熟稳定 | 成本高、数据出境风险 | 快速验证、对外服务 |
| 深度定制 | 开源 + 微调 | 完全可控 | 投入大、周期长 | 战略级应用 |
2. 经典架构
| |
开发与集成
- 版本控制:用 Git 管理 Prompt,支持回溯与多版本对比。
- 模板化设计:抽象为「模板 + 变量」,动态注入业务参数。
- 自动化测试:A/B 测试对比不同 Prompt 的准确率、相关性等。
RAG:缓解「知识陈旧」「事实性错误」
- 文档切分:按语义块切分,保证知识单元完整
- 向量化编码
- 混合检索:关键词(精准)+ 向量(广度)
- 重排序:Cross-Encoder 二次排序
Agent:工具调用与多步决策
- 工具封装:统一输入输出与接口
- 流程编排:工具调用 → 结果解析 → 下一步决策
- 记忆管理:短期 + 长期双层体系
评估与优化
从准确性、相关性、效率、用户体验四维衡量:
| 评估维度 | 核心指标 | 指标说明 |
|---|---|---|
| 准确性 | 事实准确率 | 输出与客观事实符合程度 |
| 幻觉率 | AI「瞎编」比例 | |
| BLEU | n-gram 重叠度 | |
| 相关性 | ROUGE | 对参考文本关键信息的覆盖 |
| 人工评分 | 业务标准下的主观关联度 | |
| 效率 | 响应延迟 | 请求到返回的时间 |
| 吞吐量 | 单位时间可处理请求量 | |
| 用户体验 | 满意度(CSAT) | 问卷评分 |
| 任务完成率 | 借助 AI 达成目标的比例 |
详见:BLEU 与 ROUGE
感悟:BLEU —— 别漏词,文档原文是否匹配。ROUGE —— 别漏关键点,总结是否遗漏信息。
针对薄弱环节的四项优化
- Prompt A/B 测试:对比清晰度、格式、上下文量,筛选最优指令
- 知识库质量提升:更新、去歧义、补领域知识,降幻觉
- 模型微调(LoRA):业务专属数据轻量微调
- 缓存机制:高频问答缓存,降延迟与负载
运维:监控、安全、成本
- 监控告警:响应延迟、错误率、Token 消耗与峰值;多级阈值告警
- 安全防护:Prompt 注入防范、输出过滤;输入合法性校验 + 敏感信息拦截
- 成本控制:模型分层调用、缓存、批处理;核心场景高精度、简单场景轻量模型