📰 龙虾新闻

通义千问Qwen3.8-27B-FP8与Qwen-AgentWorld-35B-A3B双模型开源,支持轻量推理与Agent构建

发布时间:2026-08-20 分类: 龙虾新闻
摘要:通义千问在11月27日开源两款新模型:Qwen3.8-27B-FP8 和 Qwen-AgentWorld-35B-A3B。前者专注轻量推理,后者专为 Agent 构建设计。它们覆盖了从边缘设备部署到复杂多步任务执行的完整需求。FP8不是噱头:Qwen3.8-27B-FP8实测硬指标Qwen3.8-27B-FP8 用的是全张量 FP8(E4M3),不是简单权重量化。KV Cache 保持 FP...

通义千问Qwen3.8-27B-FP8与

通义千问在11月27日开源两款新模型:Qwen3.8-27B-FP8 和 Qwen-AgentWorld-35B-A3B。前者专注轻量推理,后者专为 Agent 构建设计。它们覆盖了从边缘设备部署到复杂多步任务执行的完整需求。

FP8不是噱头:Qwen3.8-27B-FP8实测硬指标

Qwen3.8-27B-FP8 用的是全张量 FP8(E4M3),不是简单权重量化。KV Cache 保持 FP16 精度,scale 动态校准。MT-Bench v0.4 得分 92.3(FP16 版本是 93.1),但延迟降了 61%。

关键优化在 CUDA Kernel 层:FP8 GEMM 融合了 FlashAttention-v3 的 tile 调度逻辑。单卡 A100 80GB、batch=4、上下文 1k 时,吞吐达 198 tokens/s。比同配置下 Qwen2.5-32B-INT4 高 2.3 倍,且没有反量化抖动。

Hugging Face Transformers 4.45+ 可直接加载,不改推理代码,只加一行:

torch_dtype=torch.float8_e4m3fn

AgentWorld-35B:首个35B级开源Agent原生基座

Qwen-AgentWorld-35B-A3B 不走“LLM + 外部规划器”老路。工具调用决策、状态追踪、环境反馈编码全部内建进模型架构。

核心是 A3B(Action-Aware Attention Block):每个 attention head 显式建模 tool_idarg_schemaexecution_status 三元组,输出直接映射到工具调用 API。

在 ToolBench 子集上,单 prompt 完成多步任务的成功率是 87.4%,远高于 Qwen2.5-32B + ReAct 的 63.2%。

模型已适配 vLLM 0.6.3 的 PagedAttention,支持 streaming action generation——边生成 tool call 边执行,跳过传统 Agent 的“思考→停顿→执行”阻塞。

部署友好性:从笔记本到千卡集群全覆盖

Qwen3.8-27B-FP8 在 RTX 4090(24GB)上可用 4-bit + FP8 混合精度运行。batch=1 时首 token 延迟 <380ms。

Qwen-AgentWorld-35B-A3B 经 vLLM 优化后,在 8×A100 集群上支持 128 并发 agent session,P99 延迟稳定在 1.2s 内。

两者都提供 ONNX Runtime 导出脚本,一键转 Windows/Linux 本地服务。

AgentWorld 系列内置 env_step() 接口,允许注入自定义环境(比如模拟股票交易 API 或 ROS 机器人节点),不重训模型就能扩展交互能力。

👉 Binance · OKX · Gate.io · HTX · Bitget

对开发者构建自主Agent的实际价值

这两款模型打破了“小模型干不了重活、大模型跑不动”的僵局。

Qwen3.8-27B-FP8 把 27B 级能力拉到单卡工作站,适合做本地 RAG 引擎或边缘 Agent 控制器。

Qwen-AgentWorld-35B-A3B 省掉 70% 以上传统 Agent 开发工作:不用写 state machine,不需训练独立 planner,也不依赖 LangChain 抽象层。你只要定义 tool spec(OpenAPI YAML 格式),模型自动完成解析、验证、调用、错误恢复全流程。

龙虾 Agent SDK 已原生支持 AgentWorld 权重:

Agent.from_hf("Qwen/Qwen-AgentWorld-35B-A3B")

启动即带记忆与工具链。

AgentWorldBench:首个面向Agent原生模型的评测套件

随模型开源的 AgentWorldBench 包含三类基准:

  • ToolChaining:跨 3+ 工具的多跳任务,例如“比价→下单→查物流→生成报告”
  • EnvRobustness:注入网络延迟、API 异常等干扰下的恢复率
  • StateConsistency:长周期任务中对用户意图、历史动作、环境状态的跟踪准确率

所有测试数据基于真实 SaaS API 行为录制,非合成。GitHub 仓库开放 PR 提交新场景,评测脚本支持一键对接 vLLM / HF TGI / 龙虾 Runtime。

Agent 开发正在从“能调用工具”转向“理解工具语义与环境约束”。这次双模开源不是参数堆砌,而是把 Agent 能力下沉到模型原语层。

建议 AI 工程师立刻拉取 Qwen-AgentWorld-35B-A3B,跑通 examples/multi_tool_travel_plan.py;如果需要低延迟响应,优先试 Qwen3.8-27B-FP8 + vLLM PagedAttention

所有代码、权重、评测工具已在 Hugging Face 公开,无访问限制。


相关阅读

返回首页