三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

AI Agent白手起家16: DeepSeek云端部署与API调用实战指南

AI Agent白手起家16: DeepSeek云端部署与API调用实战指南

纲要

  • 为何选择云端部署与 API 调用
    • 低成本获取高性能算力
    • 免去本地硬件与运维负担
  • 三种资源获取方案对比
    • 本地部署、云端部署、API 调用的核心差异
  • 方案一:腾讯云一键部署 DeepSeek
    • 创建高性能应用服务实例
    • 选择社区应用,计费模式与区域配置
    • GPU 选型建议(基础型 vs 进阶型)
    • 使用 Open WebUI 直接对话
    • 获取 API 端点与公网 IP
  • 方案二:官方 API 与硅基流动
    • DeepSeek 官方开放平台
    • 硅基流动模型广场与计价
    • API Key 创建与模型选择
  • 统一接入:将云端模型导入本地 Cherry Studio
    • 添加自定义 OpenAI 兼容服务
    • 验证连接与模型切换
  • 代码实战:用 Python 调用云端 API
    • 通过公网 IP + 端口调用腾讯云部署的模型
    • 通过硅基流动 API 调用满血版 R1
    • 完整可运行脚本
  • 总结与最佳实践

为何选择云端部署与 API 调用

对于大多数个人开发者和中小团队,本地部署虽然能实现完全的数据私有化,但受限于 GPU 显存与算力,往往只能流畅运行 7B~14B 的量化模型,且需承担较高的硬件采购成本。而云端部署API 调用提供了另一种思路:按需付费、弹性伸缩,用几分钱就能调用满血版 671B 的推理能力

目前国内主流云服务商(如腾讯云、阿里云)已光速集成 DeepSeek,提供一键部署的社区应用;同时第三方模型即服务平台(如硅基流动)也提供了丰富的蒸馏版本和满血版 API,极大地降低了使用门槛。

三种资源获取方案对比

方案适用场景模型范围初始成本运维成本隐私性
本地部署高隐私、内网运行1.5B~32B(量化)高(显卡)低(电费)极高
云端部署需要高性能、弹性算力最高 32B(一键包),可自行部署更高中(按时计费)中(可控)
API 调用快速验证、低频调用全量模型,含 671B按 token 计费依赖供应商

方案一:腾讯云一键部署 DeepSeek

腾讯云高性能应用服务(HAI)已将 DeepSeek 封装为社区应用,几分钟即可拉起一个带 GPU 的推理实例。

创建实例

  1. 登录腾讯云控制台,进入「高性能应用服务」产品页。
  2. 点击「新建」,在「社区应用」中选择DeepSeek-R1-7B/14B/32B(推荐 32B 以获得最佳性能)。
  3. 计费模式:测试可选择「按量计费」;长期使用可考虑包年包月。
  4. 地域选择离自己最近的(如北京)。
  5. 算力方案:建议选择 GPU 进阶型(显存 32 GB),基础型(16 GB 显存)在跑 32B 时体验较慢。
  6. 设置实例名称,勾选协议,点击「立即购买」。

登录腾讯云控制台

高性能应用服务 HAI

新建实例

选择社区应用 DeepSeek-R1-32B

选择 GPU 进阶型

按量计费 / 确认地域

创建实例并等待 2~5 分钟

获取公网 IP 与端口

直接使用 Open WebUI

实例运行后,点击「Open WebUI」即可打开网页版对话界面。首次进入会提示创建管理员账号,之后便可直接选择已部署的模型(1.5B~32B)进行对话,体验丝滑的思维链推理。

获取 API 接口

在实例详情页的「监控」或「端口配置」中,可以看到开放的端口列表。通常6399端口映射到内部的80端口,提供 OpenAI 兼容的 API。你需要记录:

  • 公网 IP:实例详情中显示。
  • 端口:例如6399
  • API 基础路径http://<公网IP>:6399/v1

通过浏览器访问http://<公网IP>:6399/v1/models应能返回当前加载的模型列表,证明接口可用。

方案二:官方 API 与硅基流动

DeepSeek 官方开放平台

访问platform.deepseek.com可直接创建 API Key。但目前由于用户量巨大,官方暂时停止充值,存量余额可继续使用。模型提供deepseek-chat(V3)和deepseek-reasoner(R1),价格透明,百万 token 输入仅需 1 元(命中缓存更便宜)。

硅基流动(SiliconFlow)

siliconflow.cn是一个模型即服务平台,部署了大量开源模型,包含满血版DeepSeek-R1-671BDeepSeek-V3-671B以及多种蒸馏版本。注册并实名认证后,在「模型广场」选择模型,即可获取 API Key 和调用地址。

推荐模型与价格参考

模型参数量输入价格 (百万 token)输出价格 (百万 token)
DeepSeek-R1-Pro671B¥4¥16
DeepSeek-R1-Distill-Qwen-32B32B较低较低
DeepSeek-V3671B¥2¥8

调用端点统一为https://api.siliconflow.cn/v1,兼容 OpenAI 格式。

统一接入:将云端模型导入本地 Cherry Studio

无论你使用腾讯云自建 API 还是硅基流动,都可以将它们添加到 Cherry Studio 中,实现本地统一的 AI 助手界面。

  1. 打开 Cherry Studio → 设置 → 模型服务 → 添加。
  2. 提供商类型选择OpenAI,名称自定义(如“腾讯云 R1”)。
  3. API 地址填写:
    • 腾讯云:http://<公网IP>:6399/v1
    • 硅基流动:https://api.siliconflow.cn/v1
  4. API Key 填写对应的密钥(腾讯云可随意填写,硅基流动填写在平台生成的 key)。
  5. 点击「管理」,在列表中勾选你需要使用的模型,保存。
  6. 点击「检查」确认连接成功,随后即可在聊天界面切换模型。

代码实战:用 Python 调用云端 API

下面的脚本演示了如何通过 OpenAI 兼容接口分别调用腾讯云自部署的 32B 模型和硅基流动的满血版 R1,并对比输出。请根据你的实际情况替换 IP、端口和 API Key。

importopenai# ================= 配置区 =================# 腾讯云自部署(请替换为你的公网 IP 和端口)TENCENT_BASE_URL="http://123.123.123.123:6399/v1"# 替换为实际 IP:端口TENCENT_API_KEY="any-string"# 本地部署随意TENCENT_MODEL="deepseek-r1:32b"# 实例中的模型名# 硅基流动(请替换为你的 API Key)SILICON_BASE_URL="https://api.siliconflow.cn/v1"SILICON_API_KEY="sk-your-silicon-key"# 替换为真实 KeySILICON_MODEL="Pro/deepseek-ai/DeepSeek-R1"# 满血版 R1# ==========================================client_tencent=openai.OpenAI(base_url=TENCENT_BASE_URL,api_key=TENCENT_API_KEY)client_silicon=openai.OpenAI(base_url=SILICON_BASE_URL,api_key=SILICON_API_KEY)question="如何用 Python 实现快速排序?请给出带注释的代码。"print("===== 腾讯云 32B 模型 =====")resp_t=client_tencent.chat.completions.create(model=TENCENT_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_t.choices[0].message.content)print("\n===== 硅基流动 满血 R1 =====")resp_s=client_silicon.chat.completions.create(model=SILICON_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_s.choices[0].message.content)

运行说明

  • 安装依赖:pip install openai
  • 若腾讯云实例未启动,需先在控制台开机,并确保安全组允许对应端口的入站访问。
  • 硅基流动需提前注册并创建 API Key,注意模型名称可能会变动,请以平台实际显示为准。

总结与最佳实践

  • 快速体验:优先使用硅基流动或官方 API,成本极低,上手最快。
  • 团队协作或高隐私:可选择腾讯云 HA 实例部署自己的推理服务,独享 GPU,数据留存可控。
  • 生产环境:注意 API 调用速率限制(硅基流动有 RPM/TPM 限制),必要时购买更高等级套餐;自建服务需配置合适的 GPU 型号以平衡成本与性能。
  • 养成用完即关的习惯(腾讯云实例可存档或销毁),避免产生不必要的费用。

无论选择哪种方式,DeepSeek 的生态已经让“调用世界级大模型”变得像调用本地函数一样简单。接下来,你就可以将这些 API 集成到自己的 AI Agent 中,开始构建真正的智能应用。

← 返回列表