三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

一份Agent应用开发从入门到上线的技术路线图

一份Agent应用开发从入门到上线的技术路线图

很多Agent教程从十几行代码开始:创建一个Agent,挂上两个工具,再让它自己循环。Demo跑通的那一刻很有成就感,但真正接入业务后,问题会立刻变得具体。

模型把订单号提错了怎么办?退款接口已经成功,响应却超时了,能不能直接重试?知识库里同时存在新旧两版规则,该信哪一份?一次任务跑了二十轮还没停,谁来限制成本?

这些问题很少靠“再换一个框架”解决。它们分别落在数据结构、工具契约、检索、状态管理、幂等、权限、评测和部署上。

本文试图用一个“售后工单Agent”的案例进行说明:用户描述问题,系统识别诉求,查询订单和售后制度,判断是否可以退款,高风险操作交给人工确认,最后留下审计记录。沿着这个案例,我们把Agent应用开发需要的技术栈按依赖关系重新排一遍。

先看结论:

如果你已经会Python或TypeScript,建议不必先学遍所有Agent框架。更有效的顺序是:先把单次模型调用做稳定,再接一个只读工具,然后加入状态与失败恢复,最后补齐评测、安全和部署。

01 会调用大模型API,为什么还不等于会开发Agent

普通聊天应用的主要动作是“输入一段文字,生成一段文字”。Agent多了一个关键循环:模型不仅回答,还要根据环境反馈决定下一步。

一次典型运行可以写成:读取当前状态,选择动作,生成工具参数,程序执行工具,把结果交还模型,再决定继续、暂停还是结束。模型负责处理含糊信息和开放判断;普通代码负责校验、权限和副作用。

这也解释了聊天机器人、工作流和Agent的区别。

  • 聊天机器人

:主要产出自然语言,路径短,通常不改变外部系统。

  • 工作流

:步骤由程序提前定义,模型只处理其中一部分,例如先分类、再检索、最后生成回复。

  • Agent

:模型可以根据中间结果动态选择工具和步骤,执行轮数不完全固定。

Anthropic把工作流定义为“由预设代码路径编排模型和工具”,把Agent定义为“由模型动态控制过程和工具使用”。它同时建议从最简单的可行方案开始,因为自主程度越高,延迟、成本和错误累积风险通常也越高。

Anthropic用“增强型LLM”说明模型如何接入检索、工具和记忆。

售后场景就是一个很好的分界。回答“七天无理由退货怎么规定”可能只需检索加生成;真正执行退款则会修改资金状态,必须增加确定性的金额校验、权限判断、人工审批和幂等控制。

02 一张图看懂Agent应用开发的八层技术栈

把Agent理解成一个会思考的黑盒,很容易漏掉工程工作。更接近现实的看法,是把它拆成八层:底层越稳定,上层才越敢增加自主性。

从编程与API基础向上,依次连接模型接口、结构化输出、工具、上下文、编排、评测安全和用户体验。

这不是八门彼此独立的课程,而是一组依赖关系。不会处理HTTP超时和数据校验时,直接学习多Agent编排,只会把故障藏得更深。

技术层主要解决什么问题入门时至少做到
编程与API基础调用服务、并发、异常和测试会用HTTP、JSON、环境变量、异步与单元测试
模型与推理接口选择模型并控制延迟、成本记录Token、超时、流式事件和模型版本
指令与结构化输出把自然语言变成稳定数据用JSON Schema或Pydantic校验结果
工具与协议让模型读取或改变外部世界定义清楚参数、返回值、权限和副作用
上下文、RAG与记忆给当前决策提供正确事实区分工作区、检索结果、任务状态和长期信息
工作流、状态与编排控制步骤、分支和恢复能画状态图,保存检查点,设置停止条件
评测、可观测性与安全判断系统是否可用有测试集、Trace、权限表和人工升级路径
服务、存储与部署把Demo变成持续运行的产品会部署API、数据库、队列、日志和回滚

Microsoft的入门课程和Hugging Face Agents Course虽然使用的工具不同,学习顺序却很相似:先理解Agent与工具,再进入工作流、RAG、评测、生产和多Agent。这类高关注课程值得借鉴的是层次,不是照抄框架代码。

03 第一层:先学会稳定地调用模型

调用模型最先要补的,不是复杂提示词,而是普通接口能力:HTTP请求、JSON、鉴权、环境变量、同步与异步、流式返回、超时、重试和日志。

然后再掌握几个模型特有概念:系统指令与用户输入怎样分离,上下文窗口怎样计量,输入和输出Token怎样影响延迟与费用,什么时候用更强模型,什么时候把简单分类交给便宜模型。

对业务开发最实用的一步,是让模型输出有Schema的数据。售后工单不要直接返回一段“我觉得用户可能想退款”,而应该先形成可校验对象:

json

{ "intent": "refund_request", "order_id": "A202608050031", "reason": "screen_damaged", "risk_level": "high", "missing_fields": [], "next_action": "query_order" }

这里的枚举、必填字段、字符串长度和金额类型由Schema负责。模型可以判断意图,但字段是否存在、订单号格式是否正确,不应再交给模型“凭感觉检查”。结构化输出只能保证形状符合约定,不能保证事实一定正确,所以订单号还要去业务库核验。

这一层的练习目标很明确:同一批真实工单反复运行,统计Schema通过率、字段准确率、超时率和平均成本。只有单次调用稳定,后面的工具循环才有可靠输入。

04 第二层:工具调用让Agent真正开始“做事”

Function Calling常被误解成“模型调用了函数”。更准确的过程是:程序把工具名称、描述和参数Schema提供给模型;模型生成“想调用哪个工具、参数是什么”;程序校验后才真正执行,再把结果返回模型。

因此,模型没有天然权限。是否允许调用、用谁的身份调用、能访问哪些订单、调用后如何审计,都由运行时决定。MCP可以标准化客户端与工具服务之间的连接和消息,但不会自动替你设计业务权限。MCP 2026-07-28规范

售后Agent可以先只接三个工具:

  • query_order

:只读查询订单、支付与物流状态;

  • search_refund_policy

:检索带版本号和生效日期的售后规则;

  • create_refund

:有资金副作用,必须带用户身份、审批记录和幂等键。

工具说明要像写给新同事的接口文档:什么时候用,什么时候不能用,参数格式、边界条件、错误码和示例都要清楚。Anthropic在实践总结中甚至强调,他们优化工具接口花的时间多于优化总提示词。Anthropic工具设计建议

好的工具还要“难以误用”。例如退款金额不要允许自由文本“差不多三百元”,而要使用最小货币单位的整数;订单ID不要支持模糊搜索;退款工具与查询工具名称要明显区分;有副作用的操作默认要求确认。

05 第三层:把上下文、RAG、状态和记忆分开

这四个概念经常被混成“给Agent加记忆”,实际职责并不相同。

上下文窗口像当前工作桌,RAG从外部档案按需取证,任务状态记录执行进度,长期记忆只保留经过筛选的稳定信息。

Agent当前工作区不应塞入所有历史。它只需包含当前目标、必要对话、最近工具结果和下一步所需证据,其余信息按需检索或从状态恢复。

上下文窗口是模型本轮能读取的工作区;RAG是在调用前从外部资料中找回相关片段;任务状态保存“做到哪一步、哪些工具已经成功、正在等待谁审批”;长期记忆保存跨会话仍有价值的信息,例如用户确认过的偏好。KV Cache只是推理加速产生的中间状态,不能替代这些业务记忆。

售后Agent最常见的检索故障不是“完全找不到”,而是找到一份过期制度。文档入库时至少要保存版本、适用地区、生效日期和失效日期;召回时结合关键词与向量检索,再用重排序筛选;最终回复附上依据。规则冲突时,普通代码先按日期和适用范围过滤,模型再解释差异。

长期记忆也不该自动保存整段聊天。用户临时说“这次送到公司”不一定是永久地址;身份证、银行卡等敏感信息更不该因为“以后方便”就写入记忆库。写入前需要明确用途、保留周期和删除机制。

06 第四层:什么时候需要工作流和Agent框架

当任务只有一次模型调用和一个只读查询时,直接使用模型API通常更容易调试。出现多步骤、循环、人工暂停、并行或恢复需求后,再引入编排框架。

常见模式包括顺序链、条件路由、并行处理、Agent循环和“生成—评估—修改”。固定步骤多的业务,工作流更合适;步骤难以预先确定的开放任务,才更需要Agent自主选择。

需求更合适的起点原因
单模型、少量工具、希望掌握循环细节直接使用模型API抽象少,方便查看每次输入、输出和工具参数
快速构建单Agent、需要工具、Guardrail与TraceOpenAI Agents SDK提供Agent、Runner、工具、交接和追踪等少量核心原语
长时间、有状态、需要中断恢复与人工介入LangGraph强调持久化、durable execution和human-in-the-loop
.NET、Python或Go企业应用与显式工作流Microsoft Agent Framework提供Agent、会话、类型化工具、遥测和图式工作流

OpenAI Agents SDK把Agent描述为配置了指令、工具、结构化输出、Guardrail和可选交接行为的模型,并由Runner管理循环。OpenAI Agents SDK LangGraph则把自己定位为面向长时间、有状态任务的低层编排运行时,重点能力包括持久化、人工介入和把确定性节点与模型节点放在同一张图中。

Microsoft Agent Framework的文档给出一个很实用的判断:开放、对话式任务适合Agent;步骤明确、需要严格控制顺序的任务适合工作流;能用普通函数可靠解决时,就先用函数。

不要一开始就拆成五个Agent。多Agent会增加上下文复制、交接误差、成本和调试难度。先把一个Agent和几个边界清楚的工具跑稳,只有当角色确实需要不同权限、不同上下文或并行执行时,再拆分。

07 第五层:让Agent失败后可以恢复

Agent会失败并不可怕,可怕的是程序不知道失败发生在动作之前还是之后。

假设退款服务已经扣减商家余额并创建交易,但网络响应在返回前超时。运行时看到超时就重试,用户可能收到两笔退款。这个问题不是模型推理不够认真,而是副作用操作缺少幂等与状态查询。

工单先结构化、检索规则并查询订单,风险动作经过人工审批;退款超时时先按幂等键查询状态,再决定是否重试。

模型负责给出风险建议和下一步候选,程序负责金额上限、审批门槛、幂等键、超时恢复和审计。两者边界越清楚,系统越容易排错。

python

def safe_refund(order_id: str, amount_fen: int, run_id: str): key = f"refund:{order_id}:{run_id}" existing = get_refund_by_idempotency_key(key) if existing: return existing if amount_fen > 50_000: return pause_for_human_approval(key, order_id, amount_fen) return create_refund( order_id=order_id, amount_fen=amount_fen, idempotency_key=key, )

生产运行时还需要检查点、指数退避、最大重试次数、取消信号、最大循环轮数和预算上限。工具结果要区分“确定失败”“确定成功”和“结果未知”;只有结果未知时,才进入查询状态与恢复流程。

高风险步骤则使用中断点:保存当前状态,发起人工审批,收到带签名的决定后从原节点继续。不要把审批结果当成一句可以被用户消息伪造的自然语言。

08 第六层:评测、安全和可观测性决定能不能上线

“我试了十个问题,感觉不错”不能替代评测。一个可上线的Agent至少要同时看五类指标:任务是否完成、工具是否选对、参数是否有效、回答是否有依据、整个过程花了多少调用与时间。

售后Agent的测试集应覆盖正常请求、缺字段、模糊表达、旧规则冲突、无权限订单、工具超时、提示注入和重复退款请求。每个样本都记录期望工具、禁止动作、最终状态和人工升级条件,而不只比较最后一句话像不像参考答案。

Trace也不能只有模型文本。一次运行至少关联:用户与租户、模型版本、提示词版本、检索文档ID、工具参数摘要、工具结果、状态迁移、审批人、耗时、Token和错误类型。OpenAI Agents SDK的追踪会记录模型生成、工具调用、交接和Guardrail等事件,这类粒度才有助于复盘。OpenAI Agents SDK Tracing

安全侧要按“模型输出不可信输入”处理。工具采用白名单和最小权限;密钥放在服务端,不进入上下文;检索文档里的指令不能覆盖系统规则;执行代码或访问文件时使用隔离环境;删除、付款、退款和对外发送等动作增加确认与审计。

上线检查:

系统是否能在不确定时停止并转人工,是否能解释用了哪条规则,是否能撤销或补偿副作用,是否能按租户隔离数据,是否能从日志还原一次完整决策。

09 从Demo到上线,还要补哪些普通软件技术

Agent应用仍然是软件。API层可以使用FastAPI、Django、Node.js或你熟悉的框架;PostgreSQL保存业务状态和审计记录,Redis处理短期缓存与分布式锁,对象存储放文档和附件,队列承接长任务和重试。

容器、CI/CD、配置中心、灰度发布、限流、熔断、监控和回滚同样重要。模型服务偶尔超时或降级时,系统要能切换备用模型、返回可理解的等待状态,或者把任务放入队列,而不是把内部错误原样甩给用户。

成本优化也不能只盯模型单价。缓存是否命中、RAG是否塞入过多文本、循环是否无效重复、并行工具是否真的独立,都会改变整体费用。建议按“每个成功任务的总成本”统计,而不是只看“每百万Token价格”。

最终,提示词、工具Schema、检索配置、模型和评测集都要有版本。一次发布如果让工具选择率下降,团队必须知道改了什么,也必须能够回到上一版。

10 推荐的四阶段项目学习路线

学习路线最好每一阶段都交付一个能验收的项目,而不是看完课程就算完成。下面四个项目沿用同一批售后数据,后一个项目复用前一个项目的资产。

从结构化提取、知识问答、业务操作到生产上线,每一阶段都要求留下测试指标和失败证据。

作品集真正有说服力的不是界面截图,而是Schema、测试集、失败样例、Trace、权限表和恢复记录。它们能证明你理解系统为什么可靠。

01 阶段一:结构化信息提取服务

用50至100条脱敏工单做输入,输出意图、订单号、问题类型、风险等级和缺失字段。提供API、Schema、自动测试和错误重试。

  • 验收指标

:Schema通过率、关键字段准确率、P95延迟和单次成本;

  • 工程难点

:脏输入、缺字段、枚举越界和模型版本变化;

  • 作品证据

:测试脚本、混淆矩阵、失败样例及修复记录。

02 阶段二:带依据的知识问答Agent

导入多版本售后制度,完成文档切分、关键词与向量混合检索、重排序和引用。回答必须显示使用的规则版本,不确定时明确说缺什么。

  • 验收指标

:检索召回率、引用正确率、无依据回答率;

  • 工程难点

:相似旧制度、表格切分、跨段落条件和访问控制;

  • 作品证据

:标注问题集、检索对比、错误归因和版本过滤设计。

03 阶段三:能够安全操作业务系统的Agent

加入订单查询、创建售后单和模拟退款工具。只读工具可自动执行;资金动作必须通过金额规则、权限检查和人工审批。

  • 验收指标

:工具选择准确率、参数有效率、重复执行次数和人工升级率;

  • 工程难点

:超时后状态未知、幂等、审批恢复和提示注入;

  • 作品证据

:工具契约、权限矩阵、状态图、审计日志和故障演练。

04 阶段四:把Agent改造成可上线系统

把前三阶段部署成服务,加入身份认证、队列、状态存储、Trace、离线评测、监控告警、限流和回滚。用固定测试集做每次发布的回归门槛。

  • 验收指标

:端到端成功率、P95时延、每个成功任务成本、恢复时间;

  • 工程难点

:并发状态、租户隔离、模型降级和配置版本管理;

  • 作品证据

:架构图、线上演示、指标看板、发布记录和事故复盘。

如果目标是求职,这四个项目比“又做了一个聊天框”更有区分度。面试时也不要只讲用了什么框架,要能解释一次失败:在哪里发现,如何定位,为什么选择程序规则而不是继续改Prompt,修复后哪个指标发生了变化。

11 结语:框架会变化,真正积累下来的是工程能力

Agent开发确实有很多新概念,但底层工作并不神秘:把不稳定的模型判断放在合适位置,用结构化数据连接工具,用状态机承接长任务,用评测发现退化,用权限和审计约束副作用,再用成熟的软件工程把它运行起来。

学习时可以从任何一个主流框架入门,却不要把路线图写成框架目录。今天熟悉的类名可能半年后改变,HTTP、Schema、幂等、状态、检索、测试、安全和可观测性仍然存在。

真正值得长期学习的是划分边界的能力:什么交给模型,什么交给普通代码;什么可以自动执行,什么必须暂停确认;什么结果可以重试,什么动作必须先查状态。能把这些问题讲清并做进项目里,才算从“会调API”走到了“会开发Agent应用”。

—— 每日推送 AI 前沿深度解读 ——

AURORA视界 · 用AI看懂未来

关注公众号,不错过每一篇深度解读

— END —

这里给大家精心整理了一份全面的AI大模型学习资源包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

👇👇扫码免费领取全部内容👇👇

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

4. 2026行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战

学以致用,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2025 年AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】


四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2025 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

← 返回列表