Qwythos-27B-v1震撼发布:终极开源推理模型如何突破270亿参数限制?
Qwythos-27B-v1震撼发布:终极开源推理模型如何突破270亿参数限制?
【免费下载链接】Qwythos-27B-v1项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1
Qwythos-27B-v1是一款开源全参数推理模型,基于Qwen3.5-27B基础模型进行微调,通过SFT→DPO→ESFT完整训练流程打造而成。这款模型保留了基础模型原生的多令牌预测头、完整视觉塔以及1048576令牌上下文配置,为用户带来强大的推理能力和丰富功能体验。
三大核心突破:为何Qwythos-27B-v1与众不同?
Qwythos-27B-v1在众多社区27B微调模型中脱颖而出,关键在于它保留了许多常被舍弃的重要部分:
原生MTP技术保留
模型保留了一层原生MTP头及其15个张量,未做任何修改。支持MTP的运行时可利用该头进行自推测解码,大大提升推理效率。
完整视觉塔架构
Qwen3.5视觉塔完好无损,包含333个视觉张量、深度27、隐藏大小1152和输出隐藏大小5120。虽然训练仅针对文本,但视觉参数被冻结,因此图像行为继承自基础模型。
超长大上下文窗口
原生262144令牌上下文通过YaRN因子4.0扩展至1048576令牌,配置在位置1048575处经数值验证为有限,满足长文本处理需求。
强大功能体验:从终端轨迹到函数调用
终端轨迹与智能体能力
在终端/工具会话的测试中,模型困惑度从基础模型的356.6大幅降至2.76。在授权实验室网络评估的模拟Claude-Code会话中,Qwythos能够处理注入的nmap输出,分析扫描权衡,并发出正确的下一个shell形式工具调用。
原生函数调用支持
打包的聊天模板完整实现了Qwythos-3.5的工具使用规范。只需向apply_chat_template传递tools=[...],模型就会发出标准工具调用块,无需包装器和特定于工具的微调:
<tool_call> <function=NAME> <parameter=PARAM>value </tool_call>
快速上手:简单几步开始使用Qwythos-27B-v1
基本安装与配置
首先克隆仓库:
git clone https://gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1对于文本推理,使用AutoModelForImageTextToText加载模型:
from transformers import AutoModelForImageTextToText, AutoTokenizer model_id = "empero-ai/Qwythos-27B-v1" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForImageTextToText.from_pretrained( model_id, dtype="bfloat16", device_map="auto", )推荐采样参数设置
Qwythos-27B是推理模型,继承了Qwen3.5的思维模式行为。以下是generation_config.json中提供的默认值,也是推荐的起点:
| 参数 | 数值 |
|---|---|
| temperature | 0.6(智能体/工具使用)· 1.0(开放式或创意) |
| top_p | 0.95 |
| top_k | 20 |
| repetition_penalty | 1.05 |
| max_new_tokens | 16384+ |
- 智能体、工具使用场景→ 温度设为0.6,更严格的采样可保持工具调用语法和多步骤计划的稳定性。
- 开放式推理或创意工作→ 温度设为1.0,在需要模型探索而非过早确定时使用。
- 给予足够空间→ 推理轨迹较长,建议设置16384+的max_new_tokens,以容纳思考块和最终答案。
使用vLLM实现1M上下文服务
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve empero-ai/Qwythos-27B-v1 \ --max-model-len 1010000静态YaRN因子4.0存在短上下文质量权衡。对于约512k上下文,使用因子2.0;如果永远不会超过262144令牌的原生窗口,可从包含的config.json.pre_yarn备份中将rope_parameters.rope_type恢复为"default",以获得最大的短上下文保真度。
模型规格与细节
| 属性 | 值 |
|---|---|
| 基础模型 | Qwen/Qwen3.5-27B |
| 架构 | 密集型Qwen3.5-27B;混合Gated-DeltaNet线性注意力,每四层一个全注意力层(3:1) |
| 文本主干 | 64个隐藏层;隐藏大小5120;24个注意力头;4个KV头;词汇量248320 |
| 模态 | 文本+视觉,具有原生MTP |
| 精度 | bf16 |
| 上下文 | 1048576令牌:262144原生×YaRN因子4.0 |
| 原生MTP | 一个隐藏层(mtp_num_hidden_layers: 1) |
局限性说明
- 视觉功能继承而非优化:视觉塔完好无损,但文本训练未调整或评估图像理解能力。
- 长上下文的权衡:因子4.0的静态YaRN会略微降低短上下文质量;当不需要全范围时,可减少或移除该因子。
- 无审查的部署责任:模型会处理敏感但合法的技术内容;在适当情况下,需提供自己的政策、审查和访问控制。
Qwythos-27B-v1作为v1版本,是RL前的检查点,已接受全参数SFT、DPO和ESFT,本身就是一个可用的模型。RL训练的v2版本即将发布,为用户带来更强大的性能和体验。无论您是研究人员还是开发者,这款开源推理模型都能为您的项目提供强大支持,赶快尝试体验吧!
【免费下载链接】Qwythos-27B-v1项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考