📰 龙虾新闻

通义千问Qwen3.8-27B开源:FP8原生支持+AgentWorld架构,27B参数媲美Llama-3.1-405B

发布时间:2026-08-19 分类: 龙虾新闻
摘要:通义千问 Qwen3.8-27B 正式开源:FP8 原生支持 + AgentWorld 架构,27B 参数跑出接近 Llama-3.1-405B 的代码与垂域推理能力。Qwen3.8-27B 已于 2026 年 8 月 14 日 23:00 在 Hugging Face 全量发布(Apache 2.0),提供 FP8 校准权重、完整 tokenizer 和 AgentWorld 运行时接口。...

通义千问Qwen3.8-27B开源:FP

通义千问 Qwen3.8-27B 正式开源:FP8 原生支持 + AgentWorld 架构,27B 参数跑出接近 Llama-3.1-405B 的代码与垂域推理能力。

Qwen3.8-27B 已于 2026 年 8 月 14 日 23:00 在 Hugging Face 全量发布(Apache 2.0),提供 FP8 校准权重、完整 tokenizer 和 AgentWorld 运行时接口。在 HumanEval-X / CodeLlama-Bench 上代码生成得分为 78.3%;MedQA-CN、LawBench-ZH、FinBench 三项垂域测试平均准确率比 Qwen3.5-32B 高 12.6%。A100-80G 单卡上启用 FP8 + FlashAttention-3(batch=4, seq=2048),吞吐 142 tokens/s,显存占用 18.4GB——RTX 6000 Ada(96GB RAM)工作站无需任何 patch,直接运行完整 Agent 工作流。

FP8 是实打实的推理优化,不是配置开关

Qwen3.8-27B 是首个在 Hugging Face 提供完整 FP8 权重(含 activation scale cache)的开源大模型。不依赖 CUDA Graph,不绑死自定义 kernel,vLLM 0.6.4+、TGI 2.2.0、Ollama 0.4.5 开箱即用。Llama.cpp 启用 --fp8-kv 后,KV Cache 内存降 57%,32K 上下文延迟降 39%。核心是每层 attention 输出自动重归一化:scale 动态重标定,避免 FP8 常见溢出。Jetson AGX Orin 上跑通 tool calling 全流程,零微调。

AgentWorld:把 Agent 行为编译进 token logits

模型底层集成 AgentWorld v1.2 运行时,将 tool_callstate_transitionerror_recovery 三类操作直接映射为 token-level action logits。ToolBench-v2 测试中,tool call 准确率从 Qwen3.5 的 63.1% 提升至 89.7%。支持跨 step 隐式状态继承——比如“上一步生成的 SQL 需用于本次可视化”,模型自动识别为 stateful context,不靠 prompt 拼接。AgentWorld 已解耦为独立包 agentworld-core(PyPI 可 pip install),兼容龙虾(YITB)Agent SDK 和 OpenClaw,不改 orchestration 逻辑。

代码和垂域,不靠堆参数硬刚

DeepSeek-Coder-Bench(Rust/Go/C++ 多语言)综合得分 76.4,略超 Llama-3.1-405B 的 75.1(相同 prompt engineering 与 eval infra)。中文法律文书生成任务中,条款覆盖度(Clause Coverage Score)达 92.3%,比 Qwen3.5-32B 高 14.8 个百分点。这些能力不是 RLHF 后期强加的:预训练阶段就引入领域强化分词——法律条文按段落切分、金融财报字段对齐 embedding,per-layer KL divergence 分析显示领域知识密度提升 3.2 倍。

👉 Binance · OKX · Gate.io · HTX · Bitget

对标 Llama-3.1-405B:省下的不是显存,是工程时间

Llama-3.1-405B 在 MMLU 达 86.7%,但部署要 8×H100 + DP+TP,单次 tool calling 平均延迟超 2.3s。Qwen3.8-27B 在 MMLU-ZH 得 84.2,本地部署成本只有前者的 1/12。更重要的是 AgentWorld 原语让多步任务(如“分析财报→提取现金流异常→生成审计建议→转 PPT 大纲”)在一次 forward 中完成状态流转,不反复重写 prompt。5 步复合任务成功率从 61.2%(Qwen3.5 + LangChain)升至 83.6%。

现在就能动手

所有权重、tokenizer、FP8 calibration config、AgentWorld runtime 接口文档已上线 Hugging Face Qwen/Qwen3.8-27B

  • vLLM --dtype fp8 一行启动服务
  • 龙虾 Agent Studio 导入模型 ID,3 分钟接入现有 Tool Registry
  • from agentworld_core import StatefulAgent,复用已有 Python 工具链
  • 基于 qwen38_agent_template 快速构建垂类 Agent(医疗/法务/金融模板已开源)

国产大模型正在从“能跑通”走向“敢交付”。Qwen3.8-27B 不是参数缩水,而是工程权衡后的最优解:它不追求参数幻觉,只解决真实场景里的三个硬问题——延迟、显存、状态一致性。接下来三个月,关注它在边缘设备(树莓派 5 + PCIe SSD)、多模态 Agent(对接 Qwen-VL-3.8)和 RAG pipeline 中的轻量协同表现。如果你还在用 405B 做原型验证,现在该切到 27B 跑真实业务流了。


相关阅读

返回首页