Qwythos-27B-v1震撼发布:终极开源推理模型如何突破270亿参数限制?

📅 2026/8/3 21:59:36 👁️ 阅读次数 📝 编程学习
Qwythos-27B-v1震撼发布:终极开源推理模型如何突破270亿参数限制?

Qwythos-27B-v1震撼发布:终极开源推理模型如何突破270亿参数限制?

【免费下载链接】Qwythos-27B-v1项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1

Qwythos-27B-v1是一款开源全参数推理模型,基于Qwen3.5-27B基础模型进行微调,通过SFT→DPO→ESFT完整训练流程打造而成。这款模型保留了基础模型原生的多令牌预测头、完整视觉塔以及1048576令牌上下文配置,为用户带来强大的推理能力和丰富功能体验。

三大核心突破:为何Qwythos-27B-v1与众不同?

Qwythos-27B-v1在众多社区27B微调模型中脱颖而出,关键在于它保留了许多常被舍弃的重要部分:

原生MTP技术保留

模型保留了一层原生MTP头及其15个张量,未做任何修改。支持MTP的运行时可利用该头进行自推测解码,大大提升推理效率。

完整视觉塔架构

Qwen3.5视觉塔完好无损,包含333个视觉张量、深度27、隐藏大小1152和输出隐藏大小5120。虽然训练仅针对文本,但视觉参数被冻结,因此图像行为继承自基础模型。

超长大上下文窗口

原生262144令牌上下文通过YaRN因子4.0扩展至1048576令牌,配置在位置1048575处经数值验证为有限,满足长文本处理需求。

强大功能体验:从终端轨迹到函数调用

终端轨迹与智能体能力

在终端/工具会话的测试中,模型困惑度从基础模型的356.6大幅降至2.76。在授权实验室网络评估的模拟Claude-Code会话中,Qwythos能够处理注入的nmap输出,分析扫描权衡,并发出正确的下一个shell形式工具调用。

原生函数调用支持

打包的聊天模板完整实现了Qwythos-3.5的工具使用规范。只需向apply_chat_template传递tools=[...],模型就会发出标准工具调用块,无需包装器和特定于工具的微调:

<tool_call> <function=NAME> <parameter=PARAM>value </tool_call>

快速上手:简单几步开始使用Qwythos-27B-v1

基本安装与配置

首先克隆仓库:

git clone https://gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1

对于文本推理,使用AutoModelForImageTextToText加载模型:

from transformers import AutoModelForImageTextToText, AutoTokenizer model_id = "empero-ai/Qwythos-27B-v1" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForImageTextToText.from_pretrained( model_id, dtype="bfloat16", device_map="auto", )

推荐采样参数设置

Qwythos-27B是推理模型,继承了Qwen3.5的思维模式行为。以下是generation_config.json中提供的默认值,也是推荐的起点:

参数数值
temperature0.6(智能体/工具使用)· 1.0(开放式或创意)
top_p0.95
top_k20
repetition_penalty1.05
max_new_tokens16384+
  • 智能体、工具使用场景→ 温度设为0.6,更严格的采样可保持工具调用语法和多步骤计划的稳定性。
  • 开放式推理或创意工作→ 温度设为1.0,在需要模型探索而非过早确定时使用。
  • 给予足够空间→ 推理轨迹较长,建议设置16384+的max_new_tokens,以容纳思考块和最终答案。

使用vLLM实现1M上下文服务

VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve empero-ai/Qwythos-27B-v1 \ --max-model-len 1010000

静态YaRN因子4.0存在短上下文质量权衡。对于约512k上下文,使用因子2.0;如果永远不会超过262144令牌的原生窗口,可从包含的config.json.pre_yarn备份中将rope_parameters.rope_type恢复为"default",以获得最大的短上下文保真度。

模型规格与细节

属性
基础模型Qwen/Qwen3.5-27B
架构密集型Qwen3.5-27B;混合Gated-DeltaNet线性注意力,每四层一个全注意力层(3:1)
文本主干64个隐藏层;隐藏大小5120;24个注意力头;4个KV头;词汇量248320
模态文本+视觉,具有原生MTP
精度bf16
上下文1048576令牌:262144原生×YaRN因子4.0
原生MTP一个隐藏层(mtp_num_hidden_layers: 1)

局限性说明

  • 视觉功能继承而非优化:视觉塔完好无损,但文本训练未调整或评估图像理解能力。
  • 长上下文的权衡:因子4.0的静态YaRN会略微降低短上下文质量;当不需要全范围时,可减少或移除该因子。
  • 无审查的部署责任:模型会处理敏感但合法的技术内容;在适当情况下,需提供自己的政策、审查和访问控制。

Qwythos-27B-v1作为v1版本,是RL前的检查点,已接受全参数SFT、DPO和ESFT,本身就是一个可用的模型。RL训练的v2版本即将发布,为用户带来更强大的性能和体验。无论您是研究人员还是开发者,这款开源推理模型都能为您的项目提供强大支持,赶快尝试体验吧!

【免费下载链接】Qwythos-27B-v1项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwythos-27B-v1

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考