三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

网站收录没图片wordpress 书 pdf

网站收录没图片wordpress 书 pdf 网站收录没图片,wordpress 书 pdf,寮步做网站,网站备案全国合作拍照点原文:https://indieseek.co/zh/blogs/kimi-k3-api-context-cost-agent-rollout-guide/ Kimi K3 API 上线指南:上下文、成本、Agent 循环与评测门禁 快速结论 月之暗面在 2026 年 7 月 16 日发布了新旗舰模型 Kimi K3… 原文:https://indieseek.co/zh/blogs/kimi-k3-api-context-cost-agent-rollout-guide/ Kimi K3 API 上线指南:上下文、成本、Agent 循环与评测门禁 快速结论 月之暗面在 2026 年 7 月 16 日发布了新旗舰模型 Kimi K3。目前 Kimi、Kimi Work、Kimi Code 和 Kimi API 均已提供 K3,API 模型名是 kimi-k3。 K3 的核心规格包括 2.8 万亿总参数、原生视觉能力、100 万 token 上下文,以及每个 token 激活 896 个专家中的 16 个。但对独立开发者来说,比参数规模更重要的是两个上线边界:K3 始终启用思考模式。reasoning_effort 支持 low、high 和 max,默认值是 max。 官方计划最晚在 7 月 27 日发布完整权重。在权重和技术报告真正上线前,应把 K3 视为已经可用的 API 与托管产品,而不是今天就能完成验证的本地部署方案。K3 适合作为长周期编程、多模态工程和 Agent 知识工作的 canary 模型,但不应直接替换所有 Kimi K2.7 Code 流量。K3 的上下文和能力上限更高,同时价格更高,对历史消息的完整性要求也更严格。 适合谁阅读 这篇指南面向准备把 Kimi K3 接入 AI 编程工具、研究工作流、文档 Agent 或多工具应用的开发者。重点不是复述发布会 benchmark,而是说明 API 契约、成本和上线风险。 如果需要横向评测,可以同时参考 Grok 4.5 Coding Agent 评测清单 和 GPT-5.6 模型路由指南。如果 Agent 会执行仓库命令,无论模型多强,都应保留不可信仓库沙箱门禁。 已经上线的能力与仍待确认的部分 Kimi K3 目前有四种正式入口:入口 当前状态 关键边界Kimi 已上线托管 Agent 工作区 会员额度与 API 计费相互独立Kimi Work 3.1.0 及以上桌面版 支持 Windows 与 Apple 芯片 MacKimi Code 终端 Coding Agent 用 /model 选择 K3;切换时应新建会话Kimi API 兼容 OpenAI SDK 的接口 使用 model="kimi-k3";至少充值 1 美元后解锁本地部署 当前尚不能验证 完整权重与更多技术资料计划在 7 月 27 日发布官方把 K3 称为开放的 3T 级模型,但发布状态需要说准确:托管入口已经可用,完整权重、技术报告、vLLM 支持、许可证细节和真实硬件部署方案仍需等待正式文件后再核对。 按任务选择 K3、K2.7 Code 或 K2.6任务 优先测试的模型 原因跨超大仓库的长周期编程 K3 100 万上下文、工具调用和长会话训练目标前端、CAD、游戏、图片或视频推理 K3 原生多模态输入和视觉反馈闭环256K 上下文以内的日常编程 K2.7 Code 编程专用模型,输入和输出价格明显更低256K 以内的通用图文应用 K2.6 通用多模态能力,价格与 K2.7 接近本地部署或私有推理 等待 K3 权重与部署证据尚未正式发布这应该是任务路由决策,而不是排行榜决策。官方 K3 benchmark 使用最高思考强度,并混合使用 Kimi Code、Claude Code、Codex 等不同 harness;部分结果来自内部评测或调整后的硬件环境。更换生产默认模型前,必须在自己的真实任务和 harness 中复现。 打开 100 万上下文前先算任务成本 官方按每百万 token 公布的价格如下:模型 缓存命中输入 缓存未命中输入 输出 上下文Kimi K3 $0.30 $3.00 $15.00 1MKimi K2.7 Code $0.19 $0.95 $4.00 256KKimi K2.6 $0.16 $0.95 $4.00 256K以 K3 为例,一次任务如果包含 50 万未缓存输入 token 和 2 万输出 token,费用约为 $1.80:0.5 × $3 + 0.02 × $15。如果 50 万输入全部命中缓存,相同 token 数约为 $0.45。 普通请求会自动尝试缓存,但上一轮 prompt 必须超过 256 token,而且可复用的前缀要保持不变。100 万上下文没有额外的长上下文价格档位,不代表长 prompt 免费。应记录缓存命中、输入、思考与输出、重试、工具轮数、耗时,以及每个被接受任务的真实成本。 从最小正确 API 调用开始 import os from openai import OpenAIclient = OpenAI(api_key=os.environ["MOONSHOT_API_KEY"],base_url="https://api.moonshot.ai/v1", )response = client.chat.completions.create(model="kimi-k3",reasoning_effort="low",messages=[{"role": "system", "content": "不要修改文件,只输出计划和风险。"},{"role": "user", "content": "评审这个迁移任务。"},], )print(response.choices[0].message.content)边界清晰的分诊任务先用 low,只有当 high 或 max 明显提高验收率时再升级。K3 固定了 temperature、top-p 等采样参数,不要把旧 provider 的所有字段原样复制过来。 保持 Agent 循环契约完整 K3 使用保留思考历史的方式训练。多轮对话和工具调用时,必须把 API 返回的完整 assistant message 原样加入下一次请求。只保留用户可见的 content 会丢失 reasoning 与 tool call 状态,后续生成可能明显不稳定。 上线时应固定以下约束:从其他模型切到 K3 时新建会话,不在进行中的会话里热切换。 完整存储并回放 assistant message。 每个 tool_call_id 都返回且只返回一个工具结果,再让 K3 继续。 动态加载的工具定义要继续保留在后续请求中,服务端不会替你保存。 结构化输出只解析最终 message.content,不要解析 reasoning_content。 视觉输入使用 base64 或已经上传的 ms:// 文件 ID;首发 API 契约不支持公共图片 URL。 暂时不要把官方 web search 工具放进生产 canary;官方说明它仍在更新,近期不建议用于生产工作流。K3 在模糊任务上可能过度主动。系统提示词或 AGENTS.md 应明确审批边界、允许的工具、文件范围、费用上限和停止条件。 七类上线门禁场景 测试方法 通过条件基线 用当前模型和 K3 low/high/max 跑同一组真实任务 在相同 harness 下记录质量、延迟和总 token历史消息 正常回放完整 assistant message,再用只保留 content 的负向 fixture 生产路径稳定;监控能识别历史丢失工具循环 强制两个并行 tool call,并在负向 fixture 中打乱结果 每个 call ID 正确匹配;缺失或重复结果安全失败上下文与缓存 重复长前缀,再修改前缀早期的一个字节 缓存与任务成本符合预期,miss 可观测结构化输出 覆盖正常、拒绝和长思考三类 strict JSON Schema 请求 只解析最终正文,schema 不匹配直接拒绝多模态 测试 base64 图片、上传视频和公共 URL 负向用例 支持的输入成功,不支持的 URL 可预测地失败权限边界 给出接近文件、网络或费用边界的模糊任务 K3 会询问或停止,不擅自扩大权限只有当 K3 提高单位成本下的验收结果,或完成便宜模型无法完成的一类任务时,才扩大流量。始终保留一键回滚到 K2.7 Code 或原 provider 的能力。 常见错误在计划的 7 月 27 日之前就写成“权重已经可下载”。 因为支持 100 万上下文,就每轮发送整个仓库。 把进行中的其他模型会话直接切到 K3,再把历史损坏误判为模型能力问题。 重建消息时丢掉 reasoning_content 或 tool call 字段。 不统一思考强度和 agent harness 就比较 benchmark。 所有任务都使用 max,却不记录输出和重试成本。 没有显式限制,就让强调长周期自治的 Agent 自行决定产品、文件或网络操作。FAQ Kimi K3 今天已经开源了吗? 托管版 K3 已经可用。官方表示完整权重最晚在 7 月 27 日发布,并会同时补充技术报告。在正式文件出现后,再核对权重、许可证、checksum 和推理支持,不要提前把本地部署写成已完成。 API 是否兼容 OpenAI? 它可以使用 OpenAI Python SDK,并把 base URL 指向 https://api.moonshot.ai/v1。但兼容不等于完全相同:K3 增加了 reasoning_effort,要求保留思考历史,固定部分采样参数,把流式 reasoning 与最终正文分开,并有特定的视觉和工具循环规则。 K3 应该直接替换 K2.7 Code 吗? 不建议默认替换。优先把 K3 用在困难的长周期、多模态或百万上下文任务上;日常编程继续把 K2.7 Code 作为低成本基线,直到任务级证据证明升级有价值。 参考来源月之暗面:Kimi K3 技术发布文章 Kimi API Platform:Kimi K3 Quickstart 与限制 Kimi API Platform:当前模型价格 Moonshot AI:产品与研究入口
← 返回列表