AI Agent 开发学习与面试指南:11-高频面试题库与回答框架

收录基于 21 个真实岗位推断的 AI Agent 工程师高频面试题,提供技术题四段式与系统设计题六段式答题模板及核心场景破局指南。

本文目录73 个章节

第 11 章:AI Agent 工程师高频面试题库

本题库按 21 个招聘岗位的共同要求推断频率,并不声称是对真实面试题的统计。P0 应能在 60–90 秒内给出结构化答案,并结合自己的项目;P1 应能回答原理、取舍和失败案例。

一、回答方法

技术题使用四段式:

  1. 定义:一句话说明概念;
  2. 机制:说清数据流或控制流;
  3. 取舍:什么时候用、代价是什么;
  4. 证据:项目指标、失败案例或测试。

系统设计题使用六段式:需求与风险 → 架构 → 状态/数据 → 可靠性 → 安全 → 评测。

不要只罗列框架名称,也不要编造项目指标。

二、岗位理解与系统设计

1. 🔥 P0:AI Agent 工程师和普通大模型应用工程师有什么区别?

Agent 工程师不仅生成内容,还构建能规划、选择工具、维护状态并执行动作的系统。因此额外需要控制流、工具副作用、持久化、评测、可观测性、权限和人工审批。实际边界会因公司而异,读职位正文比看岗位名更重要。

追问准备:用你的项目说明一次模型决策怎样被代码约束。

2. 🔥 P0:什么场景不应该使用 Agent?

步骤固定、规则可穷举、错误代价高、要求强确定性和低延迟时,普通工作流更合适。Agent 用于路径无法完全预定义、需要动态工具选择和中间重规划的任务。生产设计通常是在 Workflow 中嵌入有限 Agent 决策。

3. 🔥 P0:请设计一个企业知识与工单 Agent。

先分四路:知识 RAG、实时工单查询、创建草稿+审批、人工转接。API 与 Worker 分离,状态/Checkpoint 存数据库;RAG 先 ACL 后 Hybrid+Rerank;Tool Gateway 做 Schema、鉴权、幂等和审计;高风险写入有审批;建立离线 Eval、Trace 和线上指标。

追问准备:跨租户隔离、超时恢复、旧 Checkpoint 升级。

4. ⭐ P1:如何把模糊业务需求变成 Agent 任务?

先定义用户结果和不做什么;列出可信数据源、工具和风险;把流程拆为原子步骤;标出模型决策与确定性规则;定义成功、失败、转人工和指标;用最小工作流验证,再逐步增加自治。

5. ⭐ P1:怎样判断 Agent 项目真正产生业务价值?

看成功任务而非对话数:完成率、首次解决率、人工时长、转接率、错误/投诉、处理周期和成功任务成本。上线前有基线,上线后用分组 A/B 或灰度比较,并监控是否把问题转移到人工后端。

三、Python、异步与后端

6. 🔥 P0:async、并发和并行有什么区别?

async 是协作式并发机制,适合 I/O 等待;并发表示多个任务在一段时间推进;并行表示多个 CPU/GPU 同时计算。远程模型/数据库适合异步,本地重计算需要进程、GPU 或专用推理服务。

7. 🔥 P0:async def 里调用阻塞函数有什么问题?

会阻塞事件循环,使同 Worker 的其他协程无法推进。优先换异步客户端;短期用 to_thread;重 CPU 或大量阻塞工作放任务队列/独立进程,并设置并发与资源限制。

8. 🔥 P0:模型 API 如何重试?

只重试 429、临时 5xx、连接错误等瞬时错误;使用指数退避、抖动、最大次数和全局截止时间;参数/权限错误不重试;写 Tool 依赖幂等;持续失败时熔断或切换经评测的备用模型。

9. 🔥 P0:什么是幂等,为什么 Agent 特别需要?

同一业务请求重复执行只产生一次效果。Agent 会自动重试、恢复或重复规划,网络超时也会造成“结果未知”,因此写 Tool 必须有幂等键、唯一约束、状态查询或补偿,不能靠 Prompt 保证不重复。

10. ⭐ P1:为什么长 Agent Run 应返回 202?

长任务容易超过网关超时并占用连接,客户端重试可能重复执行。返回 202 + run_id,后台 Worker 执行,用 SSE/WebSocket/轮询更新,支持取消、审批和恢复。

11. ⭐ P1:如何做背压?

入口限流、每租户配额、有界队列、Worker 并发、下游 Semaphore、超时和过载拒绝。无限队列不是扩容策略;还要监控排队时间和拒绝率。

四、LLM、Prompt 与上下文

12. 🔥 P0:Prompt Engineering 和 Context Engineering 的区别?

Prompt 主要设计指令、示例和输出约束;Context Engineering 管理完整输入环境,包括规则、历史、状态、检索证据、工具定义/结果和 Token 预算。后者范围更大,重点是选择、压缩和来源治理。

13. 🔥 P0:如何降低幻觉?

用 RAG/Tool 提供可信事实;证据引用与无证据拒答;结构化输出和后置校验;关键计算交给代码;高风险动作审批;固定 Eval 和线上抽检。只能降低,不能宣称完全消除。

14. 🔥 P0:结构化输出能保证正确吗?

只能提高语法和字段类型稳定性,不能保证字段事实正确。仍需 Pydantic/JSON Schema 校验、业务规则、来源核验和权限检查;模型生成的置信度也需校准。

15. 🔥 P0:Prompt、RAG、Tool、Fine-tuning 怎么选?

Prompt 定义任务和格式;RAG 提供可更新知识和引用;Tool 获取实时状态或执行动作;Fine-tuning 稳定改变行为/能力。先定位失败,再选成本最低且可验证的方案。

16. ⭐ P1:如何处理长对话?

最近窗口保留原文,旧对话做摘要,关键业务字段结构化保存;按当前任务检索相关记忆;设 Token 预算和压缩策略;评测摘要是否丢约束。不要无限追加或粗暴只截尾。

17. ⭐ P1:温度越低是否越确定?

低随机性通常更稳定,适合抽取和工具参数,但不保证完全确定,也不保证事实正确。需固定模型/参数/Prompt 版本并做多次运行统计。

五、RAG 与知识工程

18. 🔥 P0:请讲完整 RAG 链路。

解析清洗、结构恢复、分块与元数据、Embedding/稀疏索引、查询理解、召回、融合去重、Rerank、上下文预算、生成引用、检索/生成/端到端评测、线上反馈。还要包含权限过滤和增量更新。

19. 🔥 P0:Chunk 大小怎么定?

由文档结构和问题粒度决定。先做标题/段落等结构分块,建立标注查询集,比较不同大小/overlap 对 Recall@k、答案、延迟和成本的影响。没有全局最佳数字。

20. 🔥 P0:Dense、BM25、Hybrid 分别解决什么?

Dense 擅长语义和同义改写,BM25 擅长精确词、编号和新术语,Hybrid 融合两者。可用 RRF 避免分数尺度不一致,再用 Reranker 精排。

21. 🔥 P0:Rerank 为什么有效?

召回阶段用高效索引找较多候选,Reranker 逐对理解查询和文档,提高候选内排序精度。代价是延迟和成本,所以控制候选数、批处理并用数据集验证。

22. 🔥 P0:最终回答错了,怎么判断是检索还是生成?

先看标注证据是否进入候选;没进入是解析/Chunk/查询/召回。进入但太低是融合/Rerank。正确证据已进入最终上下文而回答仍错,才主要是生成/指令/冲突问题。

23. 🔥 P0:RAG 如何做权限隔离?

身份来自认证层,检索前根据 tenant、用户和文档 ACL 做 Metadata Filter;缓存 Key 带权限版本;工具再鉴权;不能先检索敏感文档再要求模型不输出。

24. ⭐ P1:如何评估 RAG?

检索测 Recall@k、Precision@k、MRR/NDCG;生成测正确、忠实、完整、引用支持和无答案拒答;端到端测任务成功、延迟、成本;安全测越权泄露率为 0。

25. ⭐ P1:何时用 GraphRAG?

实体关系、多跳路径、全局结构对任务关键时考虑。它增加实体抽取、图维护和评测成本;普通 FAQ 优先做好 Hybrid RAG。

26. ⭐ P1:Embedding 升级怎么无停机?

新建版本索引并双写/回填,离线 A/B,同一查询影子比较,完成后切读流量;保留回滚;不能在同一索引混用不兼容向量空间。

六、Agent 架构与状态

27. 🔥 P0:ReAct 与 Plan-and-Execute 的区别?

ReAct 每步根据观察选择动作,灵活但易循环;Plan-and-Execute 先计划再执行,适合长任务但计划会过时且调用更多。短工具探索用有上限 ReAct,长任务用计划+Checkpoint,固定流程不用 Agent。

28. 🔥 P0:如何设计 Agent State?

类型化保存目标、身份、已验证事实、证据、工具请求/结果、审批、步骤、错误和最终输出;区分模型建议与真实业务状态;支持序列化、版本迁移;不保存密钥。

29. 🔥 P0:如何防止无限循环?

最大步骤、时间、Token、工具次数与成本;重复动作/状态检测;无进展终止;结构化错误;必要时追问或转人工。所有限制由代码实施。

30. 🔥 P0:Checkpoint 有什么用?

每步持久化状态,支持崩溃恢复、人工审批、回放和分支实验。恢复可能重执行节点,所以副作用必须幂等;旧状态还要考虑图/Schema 版本兼容。

31. 🔥 P0:哪些逻辑不能交给模型?

身份、权限、金额上限、合法状态迁移、审批要求、超时重试、成本上限、审计和不可逆动作。模型可建议,可信代码最终决定。

32. ⭐ P1:如何分类 Agent 错误?

瞬时错误系统重试;参数/解析错误让模型有限修正;用户可修复错误暂停追问;权限错误拒绝审计;未知错误失败报警。不要把所有异常都自由文本回灌模型。

七、Tool Calling 与 MCP

33. 🔥 P0:如何设计可靠 Tool?

窄业务接口、严格 Schema、稳定结果、结构化错误、最小权限、服务端身份、超时、有限重试、幂等、风险分级、审批、审计和测试。

34. 🔥 P0:模型提出 Tool Call 后,系统要检查什么?

允许列表、参数 Schema、主体/资源权限、租户、业务状态、风险与审批、幂等键、速率/成本、目标地址和敏感字段。模型请求不等于授权。

35. 🔥 P0:MCP 和普通 Function Calling 的关系?

Function Calling 是模型表达结构化函数调用;MCP 是 Host/Client/Server 之间发现与调用 Tools、Resources、Prompts 的标准协议。MCP 解决连接标准化,不自动解决权限和信任。

36. 🔥 P0:MCP 的 Tool、Resource、Prompt 分别由谁控制?

Tool 主要由模型选择调用;Resource 由应用选择作为上下文;Prompt 通常由用户选择模板。控制方差异决定安全和 UX。

37. 🔥 P0:写 Tool 超时后能否直接重试?

先用原幂等键查询状态。若下游支持幂等可安全重试;状态未知则人工/补偿。不能生成新幂等键直接重复写,因为业务动作可能已成功。

38. ⭐ P1:MCP STDIO Server 为什么不能随便 print()

stdout 承载 JSON-RPC 协议消息,普通输出会破坏协议。日志写 stderr 或文件。HTTP 传输则没有这个冲突。

39. ⭐ P1:MCP HTTP 授权要注意什么?

OAuth 2.1、Protected Resource Metadata、Token Audience、最小 Scope、HTTPS/PKCE、短期 Token;Server 验证 Token 只为自身签发,禁止向下游透传入站 Token。

40. ⭐ P1:Tool 太多导致选择错误怎么办?

先路由场景,动态暴露小工具集;权限过滤;改进名称和互斥描述;合并重复工具;用混淆矩阵评测;关键路由改为确定性规则。

八、Memory、多 Agent 与人工审批

41. 🔥 P0:短期和长期 Memory 的区别?

短期跟随 Thread/Checkpoint,保存当前对话状态;长期跨 Thread 保存稳定偏好/事实,需 Namespace、来源、TTL、敏感级别和删除。知识库不应混成长记忆。

42. 🔥 P0:如何防止记忆污染?

只存类型化数据,不存可执行指令;写入政策、来源和 TTL;敏感/推断记忆确认;读取仍视为不可信;记忆不能扩大权限;支持审计、更正和删除。

43. 🔥 P0:什么时候用多 Agent?

子任务可并行、上下文/工具/权限需要隔离、或独立扩缩容时。先有单 Agent 基线;如果质量收益不抵延迟、成本和复杂度,不拆。

44. 🔥 P0:如何评测多 Agent?

测 Supervisor 分解、Worker 分配、消息字段、证据传递、部分失败、循环委派、越权、总步骤、成本和延迟;与单 Agent 基线 A/B。

45. ⭐ P1:审批点怎么选?

按概率、影响和不可逆性评估。外发、资金、删除、权限、代码执行和敏感数据访问通常审批;低风险读操作可预授权。审批 UI 展示动作、对象、参数、依据和后果。

九、评测与可观测性

46. 🔥 P0:如何完整评估 Agent?

确定性单元测试、组件 Eval、轨迹 Eval、端到端任务和线上业务指标。质量、安全、延迟、成本共同衡量;固定版本化数据集;线上失败回灌离线集。

47. 🔥 P0:黄金数据集怎么构建?

真实脱敏问题与专家边界案例优先,生产失败持续加入,合成数据补长尾并抽检。按风险/意图/语言分层,记录来源和版本,保留隐藏测试集。

48. 🔥 P0:LLM-as-judge 有哪些偏差?

顺序、长度、风格、同模型偏好和随机性。用明确 Rubric、人工校准、成对比较、重复运行;可规则化的指标不用 Judge。

49. 🔥 P0:Log、Metric、Trace 有什么区别?

Log 是事件;Metric 是聚合趋势;Trace 是一次请求跨模型、检索、工具的因果路径。Agent 故障定位主要靠 Trace,告警靠 Metric,详细上下文靠受控 Log。

50. ⭐ P1:如何设回归门禁?

高风险安全指标零容忍;任务成功不低于基线容忍阈值;P95 和成功任务成本不超预算;按 Split 检查少数类;人工复核显著变化样本。

十、生产、安全与模型部署

51. 🔥 P0:如何降低延迟和成本?

Trace 分解;并行独立操作;小模型路由;上下文压缩;缓存;批处理;减少重复工具和模型调用;最大步骤;流式输出;按成功任务同时看质量、延迟、成本。

52. 🔥 P0:Prompt Injection 怎么防?

无法只靠 Prompt。外部内容不可信;指令/数据分离;最小权限 Tool;服务端校验;审批;沙箱与网络限制;输出 DLP;红队数据集和监控。

53. 🔥 P0:Docker 是安全沙箱吗?

不是绝对安全。容器共享内核;特权、挂载、Socket、Capability 会扩大风险。需要非 root、只读文件系统、资源/网络限制、Seccomp/AppArmor;高风险代码使用更强隔离。

54. 🔥 P0:如何做模型降级?

Model Gateway 统一路由;每个备用模型通过相同质量/安全/Tool Eval;超时、熔断后切换;记录配置版本;不能把写动作重复发给多个模型并行执行。

55. ⭐ P1:量化有什么收益与代价?

降低显存、提高可部署规模和潜在吞吐;可能损失质量,兼容性与延迟收益依硬件/Kernel。重新评测目标任务、工具调用和安全,而非只看通用指标。

56. ⭐ P1:如何多租户隔离?

入口可信 tenant;数据库/索引 ACL;缓存 Key 带租户和权限版本;Tool 服务端再鉴权;Secret/日志隔离;跨租户红队测试;模型不能选择任意 tenant。

十一、项目与行为面

57. 🔥 P0:介绍你的 Agent 项目。

用 90 秒:业务问题 → 为什么 Agent → 架构与确定性边界 → 最难故障 → Eval 指标 → 安全与局限。不要从“我用了 LangChain”开始。

58. 🔥 P0:最严重的失败案例是什么?

按 STAR/故障复盘:现象、影响、Trace、根因、临时止损、长期修复、回归数据和预防。选择能展示工程判断的真实失败,不要说“Prompt 写得不够好”就结束。

59. 🔥 P0:你如何证明改进有效?

冻结数据集和基线;只改一个主要变量;多次运行;报告总体和分组指标、P95、成本;人工复核变化;通过门禁后灰度,线上验证业务指标。

60. ⭐ P1:如果重新做一次,你会改什么?

给具体技术债:例如先建立 Eval 再调 Prompt、先做单 Agent 基线、Tool 提前加入幂等/审批、RAG 先做权限元数据。说明预期收益和验证方法,而不是泛泛说“时间更多会优化”。

十二、面试前最后检查

你至少要准备:

  • 1 张系统架构图;
  • 1 张 Agent 状态图;
  • 1 张 RAG 链路图;
  • 1 份 Eval 指标表;
  • 1 条完整失败 Trace;
  • 1 个安全威胁模型;
  • 1 个幂等恢复故事;
  • 3 个技术取舍:为何不用多 Agent、为何 Hybrid+Rerank、为何写操作审批;
  • 真实、可复现的项目数字。

如果你只能展示聊天页面,面试官很难判断工程深度;如果你能展示状态、Trace、指标、恢复和安全边界,即使 UI 简单,也更符合生产级 Agent 岗位要求。

所属系列

AI Agent 开发学习与面试指南

下一步

继续浏览相关主题

沿着同一主题继续阅读。

查看最新资讯