智能体不是"会聊天的机器人"那么简单。它涉及文档检索、向量存储、工具调用、流程编排、安全校验一整套架构。很多技术文章一上来就甩框架名和代码,反而让人看不清全貌。本文用一个企业内部知识问答助手的实例,从需求边界到评估迭代,把搭建链路拆成五步讲透,适合想入门智能体工程化落地的读者建立整体认知。

一、为什么从"企业问答助手"入手
选这个场景不是因为它高大上,恰恰是因为它够典型、够落地、够小。
一个企业内部问答助手,覆盖了智能体构建的核心环节:要读文档(知识库)、要理解问题(语义检索)、要给出靠谱答案(生成+溯源)、有时候还要动手操作(工具调用)。但它又不像"全自动客服"那样要求极高准确率,适合作为第一个练手项目。
下面按真实搭建顺序,一步一步来。
二、五步搭建法
第一步:定边界——比"让它聪明"更重要的事
很多新手一上来就喂文档、调提示词,结果智能体什么都敢答,问它"公司明年战略是什么"它也编一段。问题出在第一步没做:没有明确边界。
一个合格的边界设定至少包含三层:
层级 | 做法 | 举例 |
能答什么 | 限定知识范围 | 产品FAQ、报销制度、项目模板、入职流程 |
不能答什么 | 设敏感拦截 | 合同金额、个人隐私、未公开财务数据、竞对信息 |
不确定怎么办 | 设兜底策略 | 回复"这个问题我暂时无法确认,已转人工" |
边界定清楚了,后面所有优化才有方向。否则就是"在错误的问题上追求正确答案"。
第二步:整理知识源——文档质量决定上限
这一步最枯燥,也最关键。
真实企业环境里的文档通常是这样的:PDF制度文件没有目录、Word手册版本混乱、历史工单散在聊天记录里、常见问题表三年没更新。直接把这些丢给智能体,检索效果会非常差。
标准清洗流程:
去重:同一份制度可能有2022版和2024版,只保留最新有效版;
补结构:给每个文档加标题、章节号、生效日期;
标来源:每段内容标注出自哪个文件第几章,方便溯源;
拆粒度:大文件按主题拆成5–10段的小块,太长的段落检索时容易"稀释"相关度;
清噪音:去掉页眉页脚、水印文字、扫描件里的乱码。
做完这些,你的知识库才真正"可用"。很多团队卡在这一步——不是技术不行,是文档太乱。
第三步:做检索增强(RAG)——让回答有依据
这是智能体跟普通聊天机器人最大的区别之一。
核心逻辑很简单:
用户提问 → 把问题转成向量 → 去向量库里找"语义最像"的文档段落 → 把这些段落和原问题一起交给生成模块 → 输出答案时附带出处引用。
这样做有两个好处:
降低编造概率:模型不是凭"记忆"答题,而是看着你给的文档答,有据可查;
可溯源:用户能看到"这个答案来自《报销制度V3.0》第4.2条",信任感完全不同。
新手常见误区:
切段太碎:一段话被切成三截,语义不完整,检索回来拼不起来;
切段太长:一段5000字,真正相关的可能就两句话,模型反而不聚焦;
不更新向量库:文档改了但向量没重算,智能体还在引用旧版本。
经验值:每段300–800字、有完整语义单元,是比较舒服的区间。
第四步:接工具与流程编排——从"能说"到"能做"
如果只做问答,检索增强就够了。但真实场景往往需要它动手:
员工问"我的年假还剩几天" → 需要调用HR系统接口查数据;
客户问"订单到哪了" → 需要调用物流查询接口;
用户问"帮我提个IT报修" → 需要往工单系统写一条记录。
这就进入了工具调用(Function Calling)环节。
一个典型的流程编排长这样:
接收问题
↓
意图分类(是纯知识问答?还是要查数据?还是要提交操作?)
↓
知识类 → 走检索增强 → 生成回答 → 敏感词检查 → 输出
↓
操作类 → 调对应API → 确认参数 → 执行 → 返回结果 → 输出
↓
不确定类 → 转人工 + 记录日志
关键点:
每类操作都要做参数校验(比如报修单必须有联系方式,缺了就反问补全);
所有写操作(提交、修改、删除)建议加二次确认;
敏感词检查放在生成之后、输出之前,防止模型"绕过"规则。
第五步:评估与迭代——别靠感觉,靠数据
上线不是结束,是真正优化的开始。
至少跟踪四个指标:
指标 | 怎么算 | 关注什么 |
准确率 | 人工抽检100条,答对几条 | 低于80%优先优化检索和提示词 |
漏检率 | 该检索到没检索到的比例 | 检查切段策略和向量模型是否匹配业务语言 |
平均响应 | 从提问到输出用了几秒 | 超过5秒考虑缓存热门问题或换轻量模型 |
转人工率 | 多少问题最终转了人工 | 转人工的高频问题就是下一步要补充进知识库的 |
迭代节奏建议:
第1周:每天看误答案例,修提示词和文档;
第2–4周:每周更新一次知识库,调整检索参数;
第1个月后:按月复盘,考虑是否增加新工具或拆分多智能体。

三、学习路线建议
按"先跑通、再深入"的原则,分五个阶段:
基础期(1–2周)
搞懂对话模型的基本工作方式:输入→推理→输出;
学会写结构化提示词:角色+任务+约束+输出格式;
理解Token、上下文窗口、温度参数这些基础概念。
知识期(2–3周)
文档解析:PDF/Word/Excel怎么提取纯文本;
文本切分策略:按字符、按句子、按语义;
向量化:了解嵌入模型怎么把文字变成数字;
向量检索:余弦相似度、Top-K、混合检索(关键词+语义)。
工具期(2–3周)
API基础:GET/POST请求、鉴权、返回格式解析;
函数调用:怎么定义工具描述、参数Schema、返回处理;
常见集成:表单写入、日历操作、邮件发送、数据库查询。
编排期(3–4周)
单智能体工作流:条件分支、循环、并行;
多智能体协作:一个负责调研、一个负责写作、一个负责核查;
异常处理:超时、失败重试、降级策略。
工程期(持续)
日志系统:记录每次交互的输入输出和耗时;
评估体系:自动化测试集+人工抽检;
权限管理:谁能改知识库、谁能看日志、谁能调工具;
内容安全:敏感词库、输出过滤、审计追踪。
给初学者的建议: 低代码平台(如Dify、Coze等)适合快速验证想法,开源框架(如LangChain等)适合深度定制。别一开始就追框架——先完成"一个知识库+一个工具+一个评估表"的最小闭环,比追任何新框架都有价值。
IITC工信人才交流中心智能体构建师认证办理北京青蓝智慧马老师133-9150-9126/丁老师135-2209-4648

四、关于系统学习的一点提醒
如果你考虑参加相关课程或训练营,建议按这个顺序判断:
先看项目是否贴近你的实际场景——学完能直接用在自己工作里,比"老师演示很酷但你用不上"强得多;
看有没有作业批改和代码复盘——光看视频不动手,学完就忘;
看答疑响应速度——卡住没人管,最容易半途而废;
报名前务必签署培训协议——确认课时、内容、作业量、复训规则和退费条款,白纸黑字比口头承诺可靠。
