📰 龙虾新闻

Kev模型开源:基于Qwen3.5的1.5B–3B轻量决策模型,支持单卡实时Agent动作规划

发布时间:2026-09-23 分类: 龙虾新闻
摘要:Kev模型家族正式开源:基于Qwen3.5构建的轻量级决策模型,参数量1.5B–3B,A10G上推理速度28 tokens/s,单卡可部署,支持实时Agent动作规划。Kev不是通用大模型。它专为「决策密集型」AI Agent设计,复用Qwen3.5的语义理解能力,但彻底重构顶层——去掉文本生成头,换成多任务决策头(Action Classification + Confidence Sco...

Kev模型开源:基于Qwen3.5的1.

Kev模型家族正式开源:基于Qwen3.5构建的轻量级决策模型,参数量1.5B–3B,A10G上推理速度28 tokens/s,单卡可部署,支持实时Agent动作规划。

Kev不是通用大模型。它专为「决策密集型」AI Agent设计,复用Qwen3.5的语义理解能力,但彻底重构顶层——去掉文本生成头,换成多任务决策头(Action Classification + Confidence Scoring + Step Ranking),直接输出结构化动作指令,例如:

{"action": "click", "target": "[button#submit]", "confidence": 0.92}

在WebArena和Mind2Web上,Kev-3B比Claude-3-Haiku高12%,延迟低67%;FP16下内存占用仅4.1GB,比Llama-3-8B低58%。龙虾(YITB)开发者已将Kev嵌入OpenClaw Agent的Policy Layer,替代原有规则+LoRA混合方案,网页自动化任务成功率从73%升至89%。

技术架构:解耦带来速度与确定性

Kev不靠堆参数,靠解耦:Qwen3.5主干只做语义编码,保留attention cache复用能力;所有决策逻辑由三层轻量MLP完成——

  • 第一层:原子动作分类(47类,覆盖点击、输入、滚动、上传等Web交互)
  • 第二层:对每个候选动作打置信分
  • 第三层:多步排序(最长支持5步前瞻)

全部层采用int8量化感知训练(QAT),权重无动态分支、无条件计算,跳过LLM典型的token-by-token自回归开销。Kev不调用外部API,也不依赖ReAct框架,输出天然匹配龙虾SDK的ActionPlan Schema,可直连Playwright或AutoGen执行器。

实际影响:省掉三类工程成本

  • 部署成本:Kev-1.5B在Jetson AGX Orin上以16-bit运行,吞吐11 tokens/s;单张A10G支撑20并发Agent会话。相比过去4×A100跑Llama-3-8B+RAG的方案,硬件投入减少76%。
  • 微调门槛:官方提供LoRA+QLoRA双模式微调脚本,但多数场景下50条标注样本+30分钟就能适配新流程(比如银行网银转账路径),无需改模型结构。
  • 可观测性:原生输出confidence score与step ranking,配合龙虾控制台的Decision Trace面板,可逐帧回放Agent每一步依据,调试周期明显缩短。

👉 Binance · OKX · Gate.io · HTX · Bitget

可落地用法:三条路径覆盖不同阶段

  • 快速验证pip install kev-sdk后,5行代码接入现有Agent:

    from kev import KevPolicy  
    policy = KevPolicy(model_path="kev-3b", device="cuda:0")  
    action = policy.plan(task="登录并查询余额", context=dom_snapshot)  

    支持DOM树、OCR文本、截图三模态输入,自动对齐龙虾的PageState对象。

  • 深度定制:用kev-finetune工具链,在私有业务数据(如CRM操作日志)上全参数微调。实测:仅200条历史工单操作记录,Kev在内部IT服务机器人任务中F1达0.84,超过人工规则引擎。
  • 边缘协同:把Kev-1.5B蒸馏为ONNX,部署到树莓派5+USB摄像头组合,实现离线物理设备控制(如实验室仪器开关序列),响应延迟<350ms。

行业意义:决策模型正在独立成层

Kev标志着AI Agent技术栈的关键分层:语言模型负责“理解世界”,决策模型专注“选择动作”,执行引擎确保“精准落地”。这结束了过去硬塞7B以上通用模型进决策场景的浪费做法。更实际的影响已经发生——Hugging Face为Kev新增DecisionModel模型卡类型,vLLM团队正开发专用调度器,支持非自回归决策头。对开发者来说,现在是重构Agent架构的好时机:与其堆更大LLM,不如用Kev替换Policy Layer,把省下的算力投向更可靠的Observation Encoding和Execution Robustness。

立即行动:访问 kev.yitb.com 下载模型、运行Demo Notebook,并在龙虾控制台启用Kev Acceleration Mode(设置→Agent Runtime→Policy Engine)。你第一条真正轻量、可控、可解释的决策Agent,今晚就能上线。


相关阅读

返回首页