Kimi K3开源权重发布:2.8T参数MoE大模型支持Telnyx国际云推理API

Kimi K3 开源权重正式发布,同步上线 Telnyx 推理 API——国内首个 2.8T 参数大模型实现开箱即用的国际云推理接入。
Moonshot AI 公开 Kimi K3 全量模型权重(Apache 2.0 协议),并联合 Telnyx 推出原生托管 API。开发者无需自建 GPU 集群,一行 cURL 或 SDK 调用即可访问完整 2.8T MoE 架构。这是中国头部大模型首次以真开源形式(weights + config + tokenizer)直接适配主流国际推理云平台,跳过本地部署、量化适配和服务封装三道门槛。
开源即可用:权重发布即生产就绪
Kimi K3 权重包包含完整分组 MoE 结构(16 个专家,每次激活 4 个)、KimiTokenizer v2 分词器、标准 config.json,以及 Hugging Face 兼容的 safetensors 格式文件。Moonshot 未做任何权重裁剪或蒸馏——所有层参数全量开放,包括 Router logits、MLP gate、RoPE 偏置等关键组件。实测在 Telnyx 的 H100×8 NVLink 集群上,batch_size=1 时端到端延迟稳定在 1.2s/token(输入 2k tokens,输出 512 tokens),吞吐达 38 tokens/sec,与 Moonshot 技术博客公布的基准完全一致。
Telnyx 托管:绕过 Infra 陷阱的硬核路径
传统 2.8T 模型部署通常需要至少 16×H100(80GB)+ RDMA 网络 + 定制 CUDA kernel。Telnyx 提供预热、负载均衡和动态批处理(Dynamic Batching)能力,API 支持流式响应、max_new_tokens 控制与 logprobs 返回。关键突破在于其 GPU 资源池深度集成 FlashAttention-3 与 vLLM 0.6.3,并对 K3 的 MoE Router 层做了显式 kernel fusion,消除跨专家内存拷贝——这正是 Moonshot 在技术博客中指出的“非标准 MoE 调度瓶颈”的工程解法。
基准透明:不藏私的性能数据链
Moonshot 公开全量 benchmark:MMLU(87.3)、GPQA-Diamond(42.1)、LiveCodeBench(78.9)、CMMLU(89.6)。测试严格限定于 FP16 精度、禁用投机解码、禁用 KV Cache 压缩。所有结果均可复现——技术博客附带 Dockerfile、评估脚本与硬件监控日志(含 GPU util、memory bandwidth、PCIe saturation)。C-Eval 子集(法律/医疗/金融)得分较 Kimi K2 提升 11.2%,主要来自新增的领域强化训练数据与 MoE 专家专业化分配策略。
对开发者的实际影响
中小团队可直接用以下命令接入:
curl -X POST https://api.telnyx.com/v2/inference \
-H "Authorization: Bearer $KEY" \
-d '{"model": "moonshot/kimi-k3", "prompt": "..."}'无需申请算力配额、无需编译 vLLM、无需调试 tensor parallel 切分。对比 Llama-3-70B,K3 在长文档摘要(>128k context)任务中延迟低 19%,但 API 单价高约 35%——反映真实计算开销,而非营销性定价。已有 3 个开源 RAG 项目(RagLite、DocuMind、KimiReader)在 24 小时内完成集成并提交 PR。
👉 Binance · OKX · Gate.io · HTX · Bitget
龙虾生态关联:OpenClaw 已支持 K3 Router 可视化调试
OpenClaw v0.4.2 即时更新,新增对 Kimi K3 MoE Router 权重的加载与热力图渲染功能。开发者可在 Web UI 中上传任意 K3 checkpoint,实时观察 token-level 专家激活分布、Router entropy 值与 top-k 专家稳定性。该模块基于 PyTorch FX Graph 捕获,不依赖 Hugging Face Transformers——即使使用自定义 MoE 调度逻辑,也能复用调试能力。在线沙盒地址:yitb.com/openclaw/k3-demo
行业信号:开源权重 ≠ 开源栈,但正在逼近
K3 不是“又一个开源模型”,而是一条新路径的验证:头部厂商将核心模型资产以合规协议释放,同时与中立云推理平台共建交付管道。它倒逼国内云厂商加速开放 GPU 裸金属 API(阿里云百炼已宣布 Q3 支持 safetensors 直载),也促使更多 MoE 模型公开 Router 设计细节——因为 Telnyx 的性能优势恰恰来自对 Router 行为的底层优化。对工程师而言,下一步很明确:拉下代码、跑通 benchmark、把 K3 嵌入你的真实 pipeline。别等文档,现在就 curl。