三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

LLMOps 这词,我一个做运维的琢磨了两个月

LLMOps 这词,我一个做运维的琢磨了两个月

我们团队去年接了个新摊子:把公司内部的几个对话模型对外提供服务。领导在会上提了一嘴"这叫 LLMOps",我当时心里咯噔一下——又来新词,是不是又要我加班学一套没听说过的东西?会后我还偷偷搜了下,出来的文章一半在造词,看得我头大。

但我转念一想,管它叫什么,活儿不还是部署、监控、救火那三样么。我决定不从名词入手,直接从我们那个模型服务的具体问题入手——哪里慢、哪里贵、哪里崩。名词搞不懂就先放下,问题摆在那儿跑不掉。

我做了五年 SRE,日常就是监控、部署、扩容、救火。一听"Ops"这个尾巴,我第一反应是:这不还是运维么?后来真上手,发现它确实披着新皮,但里子我熟。

先说像的地方。模型服务上线,照样要容器化、要健康检查、要灰度发布。我之前管的一堆微服务那套流程,原封不动搬过来就能用。监控也一样,QPS、延迟、错误率,这些老指标一个不少。有回一个新来的同事非要重新搭一套"专属大模型监控",我看了眼说,你这不就是把请求成功率换个名字么,直接用咱们现有的面板加两个图就行。他省了三天工。

后来我干脆把那套面板模板化,新接一个模型服务,复制一份改改指标名就能用。省下的不是三天,是以后每个模型都省三天。这种"一次理顺、处处复用"的懒办法,是我做运维年头里最值钱的习惯。

但第一次部署就给了我一个下马威。我照老习惯配了健康检查,容器起来就标就绪,结果模型要几十秒才加载完,那几十秒进来的请求全打在没准备好的实例上,报错刷屏。我改了 readiness,让它等模型真正加载完才接流量,才算稳。这活儿听起来新,本质还是我干了多年的"服务没好别放流量",只是判断"好没好"的标准变了。

还有回做灰度,我把新版本模型放了 10% 流量,结果错误率悄悄涨,查了半天才发现新模型对长文本更挑,长请求容易超时。我加了个按长度分流的策略才压住。这种"同一份服务,不同输入表现不一样"的坑,是以前普通 API 很少有的。

真有不同的地方,而且不小。最明显的是机器贵。以前我扩容看 CPU 和内存,现在盯的是显存和 GPU 利用率。一张卡几千块,空转就是烧钱。有回晚上流量低,我按老习惯把副本数压到最少,结果第二天早高峰,模型加载要几十秒,用户全卡在加载页。那次我学乖了:GPU 服务的冷启动和以前不一样,缩容得留余量,不能像以前那样压到零。

还有成本这头。模型按 token 算钱,产品同学写个提示词没数,一个请求甩进来上万 token,月底账单吓一跳。我后来加了个统计,把每个接口的 token 消耗拉出来,跟产品说"你们这个闲聊接口太费了,要么限长要么加缓存"。这事以前我不用管,现在得操心,等于我多了一本账要算。

有回我看账单发现,同一个模型被两个接口重复调用,明明可以共用一份缓存。我加了层共享缓存,当月那块成本直接砍掉三成。产品知道后有点意外,说没想到运维也能省他们的钱。我说,账算细了,处处是省法。

记得有次模型服务半夜告警,我爬起来一看是显存满了,排查半天才发现是个批处理任务把卡占满没释放。这和我早年查内存泄漏一个套路,只是工具换成了 nvidia-smi。还有一回,两个团队抢同一张卡,互相把对方挤崩了,我只好上了个排队和限额,谁也不能独占。这种"多人共用贵硬件"的调度,是以前管普通服务时很少碰的。

为了看清钱花哪了,我做了张按团队、按模型的占用表,每周发一封。起初没人看,有回一个团队发现自己的测试任务占了一张卡一整周,自己默默停了。那一刻我知道,把账摊开,比我去催更有效。

提示词版本管理也算新鲜事。以前代码上线有 git,现在"提示词"也在悄悄迭代,谁改了、为什么改、效果如何,经常没人记。我拉着算法同学把提示词也进了版本库,每次变更留记录,出问题能回滚。这活儿听着新,其实本质就是我干了多年的配置管理,只是对象从配置文件变成了那段文字。

顺带还加了道关卡:提示词改动要附一句"为什么改",不然不准合入。起初大家嫌烦,后来有回线上效果掉了,我们五分钟就翻到那次改动,定位到是新加的一句限制把某些问题挡在门外。没有记录的话,这种排查得耗一天。

也有反过来的时候。有回算法同学兴冲冲说要上新模型,我拿着之前的占用表和成本先算了一笔,发现这个新模型显存需求是旧的两倍,按现有卡数高峰会撑爆。我提前找老板要了预算扩卡,没等线上崩才补救。这种"先算后上"的习惯,跟当年评估容量一个道理。

过程中最头疼的不是技术,是跟算法、产品、老板把预期磨合清楚——算法要效果、产品要便宜、老板要稳。这倒是和我平时的工作一模一样。

有回产品同学问我,LLMOps 是不是以后能取代我们运维。我反问他:取代啥?模型挂了谁爬起来重启,账单爆了谁去砍副本,线上一抖谁去兜底?他愣了下说,那还是你。我说对,活儿换了个对象,干活的人没换。

我也纠正过一个常见误会:不少人以为 LLMOps 就是"把模型部署上线"那一下的事。其实部署只占一成,剩下九成是上线之后——怎么不让它悄摸变贵、怎么在效果回退时快速回滚、怎么在卡不够时排好队。这才是运维真正要扛的。

说回开头那句"新瓶装旧酒"。我的结论是,瓶子确实是旧的,酒也没换成别的,只是装的液体更贵、更容易洒。老的运维本事——稳、快、省——照样管用,但得补上 GPU 调度和成本这两课。它算机会吗?算,因为确实有新问题要解:怎么把贵显卡用满、怎么不让账单爆、怎么在多团队间分好资源;但它不是凭空冒出来的新世界,别被词吓住。

我后来跟一个做开发的兄弟聊起,他说他们组也在接模型相关的活,问我要不要调过去。我想了想说,不用调,我就在原岗位把这块接了,反而比过去清楚自己每天在扛啥。

网上有人说 LLMOps 是"运维的下一个风口",我看了只想笑——风口不风口的,活儿还是那些活儿,只是老板愿意为它多拨点预算了。

这俩月我最大的感触是,别被一个新名词吓退,也别被它忽悠上头。我没什么高明见解,就是劝你一句:如果你也是做运维、做稳定性的,先把手里那套监控部署的功夫用上,遇到 GPU 和账单这种新东西,一个个啃。它没你想得那么神,也没你想得那么远。我到现在也没觉得自己成了什么专家,只是不再看见"LLMOps"就头疼了。

如果非让我给个实在的总结:它没创造一个新职业,它只是给老职业换了批更贵的设备。你原来怎么稳服务、怎么控成本、怎么救火,现在一样用,只是对象从普通容器变成了跑模型的卡。带着这本事进场,你不会慌;扔了这本事只想追新词,那才真会慌。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】


四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

← 返回列表