纲要
- 为何选择云端部署与 API 调用
- 低成本获取高性能算力
- 免去本地硬件与运维负担
- 三种资源获取方案对比
- 本地部署、云端部署、API 调用的核心差异
- 方案一:腾讯云一键部署 DeepSeek
- 创建高性能应用服务实例
- 选择社区应用,计费模式与区域配置
- GPU 选型建议(基础型 vs 进阶型)
- 使用 Open WebUI 直接对话
- 获取 API 端点与公网 IP
- 方案二:官方 API 与硅基流动
- DeepSeek 官方开放平台
- 硅基流动模型广场与计价
- API Key 创建与模型选择
- 统一接入:将云端模型导入本地 Cherry Studio
- 添加自定义 OpenAI 兼容服务
- 验证连接与模型切换
- 代码实战:用 Python 调用云端 API
- 通过公网 IP + 端口调用腾讯云部署的模型
- 通过硅基流动 API 调用满血版 R1
- 完整可运行脚本
- 总结与最佳实践
为何选择云端部署与 API 调用
对于大多数个人开发者和中小团队,本地部署虽然能实现完全的数据私有化,但受限于 GPU 显存与算力,往往只能流畅运行 7B~14B 的量化模型,且需承担较高的硬件采购成本。而云端部署与API 调用提供了另一种思路:按需付费、弹性伸缩,用几分钱就能调用满血版 671B 的推理能力。
目前国内主流云服务商(如腾讯云、阿里云)已光速集成 DeepSeek,提供一键部署的社区应用;同时第三方模型即服务平台(如硅基流动)也提供了丰富的蒸馏版本和满血版 API,极大地降低了使用门槛。
三种资源获取方案对比
| 方案 | 适用场景 | 模型范围 | 初始成本 | 运维成本 | 隐私性 |
|---|---|---|---|---|---|
| 本地部署 | 高隐私、内网运行 | 1.5B~32B(量化) | 高(显卡) | 低(电费) | 极高 |
| 云端部署 | 需要高性能、弹性算力 | 最高 32B(一键包),可自行部署更高 | 中(按时计费) | 无 | 中(可控) |
| API 调用 | 快速验证、低频调用 | 全量模型,含 671B | 无 | 按 token 计费 | 依赖供应商 |
方案一:腾讯云一键部署 DeepSeek
腾讯云高性能应用服务(HAI)已将 DeepSeek 封装为社区应用,几分钟即可拉起一个带 GPU 的推理实例。
创建实例
- 登录腾讯云控制台,进入「高性能应用服务」产品页。
- 点击「新建」,在「社区应用」中选择
DeepSeek-R1-7B/14B/32B(推荐 32B 以获得最佳性能)。 - 计费模式:测试可选择「按量计费」;长期使用可考虑包年包月。
- 地域选择离自己最近的(如北京)。
- 算力方案:建议选择 GPU 进阶型(显存 32 GB),基础型(16 GB 显存)在跑 32B 时体验较慢。
- 设置实例名称,勾选协议,点击「立即购买」。
直接使用 Open WebUI
实例运行后,点击「Open WebUI」即可打开网页版对话界面。首次进入会提示创建管理员账号,之后便可直接选择已部署的模型(1.5B~32B)进行对话,体验丝滑的思维链推理。
获取 API 接口
在实例详情页的「监控」或「端口配置」中,可以看到开放的端口列表。通常6399端口映射到内部的80端口,提供 OpenAI 兼容的 API。你需要记录:
- 公网 IP:实例详情中显示。
- 端口:例如
6399。 - API 基础路径:
http://<公网IP>:6399/v1
通过浏览器访问http://<公网IP>:6399/v1/models应能返回当前加载的模型列表,证明接口可用。
方案二:官方 API 与硅基流动
DeepSeek 官方开放平台
访问platform.deepseek.com可直接创建 API Key。但目前由于用户量巨大,官方暂时停止充值,存量余额可继续使用。模型提供deepseek-chat(V3)和deepseek-reasoner(R1),价格透明,百万 token 输入仅需 1 元(命中缓存更便宜)。
硅基流动(SiliconFlow)
siliconflow.cn是一个模型即服务平台,部署了大量开源模型,包含满血版DeepSeek-R1-671B、DeepSeek-V3-671B以及多种蒸馏版本。注册并实名认证后,在「模型广场」选择模型,即可获取 API Key 和调用地址。
推荐模型与价格参考:
| 模型 | 参数量 | 输入价格 (百万 token) | 输出价格 (百万 token) |
|---|---|---|---|
| DeepSeek-R1-Pro | 671B | ¥4 | ¥16 |
| DeepSeek-R1-Distill-Qwen-32B | 32B | 较低 | 较低 |
| DeepSeek-V3 | 671B | ¥2 | ¥8 |
调用端点统一为https://api.siliconflow.cn/v1,兼容 OpenAI 格式。
统一接入:将云端模型导入本地 Cherry Studio
无论你使用腾讯云自建 API 还是硅基流动,都可以将它们添加到 Cherry Studio 中,实现本地统一的 AI 助手界面。
- 打开 Cherry Studio → 设置 → 模型服务 → 添加。
- 提供商类型选择
OpenAI,名称自定义(如“腾讯云 R1”)。 - API 地址填写:
- 腾讯云:
http://<公网IP>:6399/v1 - 硅基流动:
https://api.siliconflow.cn/v1
- 腾讯云:
- API Key 填写对应的密钥(腾讯云可随意填写,硅基流动填写在平台生成的 key)。
- 点击「管理」,在列表中勾选你需要使用的模型,保存。
- 点击「检查」确认连接成功,随后即可在聊天界面切换模型。
代码实战:用 Python 调用云端 API
下面的脚本演示了如何通过 OpenAI 兼容接口分别调用腾讯云自部署的 32B 模型和硅基流动的满血版 R1,并对比输出。请根据你的实际情况替换 IP、端口和 API Key。
importopenai# ================= 配置区 =================# 腾讯云自部署(请替换为你的公网 IP 和端口)TENCENT_BASE_URL="http://123.123.123.123:6399/v1"# 替换为实际 IP:端口TENCENT_API_KEY="any-string"# 本地部署随意TENCENT_MODEL="deepseek-r1:32b"# 实例中的模型名# 硅基流动(请替换为你的 API Key)SILICON_BASE_URL="https://api.siliconflow.cn/v1"SILICON_API_KEY="sk-your-silicon-key"# 替换为真实 KeySILICON_MODEL="Pro/deepseek-ai/DeepSeek-R1"# 满血版 R1# ==========================================client_tencent=openai.OpenAI(base_url=TENCENT_BASE_URL,api_key=TENCENT_API_KEY)client_silicon=openai.OpenAI(base_url=SILICON_BASE_URL,api_key=SILICON_API_KEY)question="如何用 Python 实现快速排序?请给出带注释的代码。"print("===== 腾讯云 32B 模型 =====")resp_t=client_tencent.chat.completions.create(model=TENCENT_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_t.choices[0].message.content)print("\n===== 硅基流动 满血 R1 =====")resp_s=client_silicon.chat.completions.create(model=SILICON_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_s.choices[0].message.content)运行说明:
- 安装依赖:
pip install openai - 若腾讯云实例未启动,需先在控制台开机,并确保安全组允许对应端口的入站访问。
- 硅基流动需提前注册并创建 API Key,注意模型名称可能会变动,请以平台实际显示为准。
总结与最佳实践
- 快速体验:优先使用硅基流动或官方 API,成本极低,上手最快。
- 团队协作或高隐私:可选择腾讯云 HA 实例部署自己的推理服务,独享 GPU,数据留存可控。
- 生产环境:注意 API 调用速率限制(硅基流动有 RPM/TPM 限制),必要时购买更高等级套餐;自建服务需配置合适的 GPU 型号以平衡成本与性能。
- 养成用完即关的习惯(腾讯云实例可存档或销毁),避免产生不必要的费用。
无论选择哪种方式,DeepSeek 的生态已经让“调用世界级大模型”变得像调用本地函数一样简单。接下来,你就可以将这些 API 集成到自己的 AI Agent 中,开始构建真正的智能应用。