📰 龙虾新闻

Moonshot AI开源Kimi K3大模型2.8T参数全量权重,支持Telnyx国际API推理与2M上下文

发布时间:2026-07-31 分类: 龙虾新闻
摘要:Moonshot AI 开源 Kimi K3 全量权重(2.8T 参数),同步上线 Telnyx 推理 API——国内首个支持开箱即用接入国际商用推理平台的国产大模型。开发者无需自建 GPU 集群,直接调用 Telnyx 托管的专属 A100/H100 资源。端到端 P99 延迟稳定在 420ms(16K tokens 输入 + 512 tokens 输出),吞吐 18 tokens/sec...

封面

Moonshot AI 开源 Kimi K3 全量权重(2.8T 参数),同步上线 Telnyx 推理 API——国内首个支持开箱即用接入国际商用推理平台的国产大模型。

开发者无需自建 GPU 集群,直接调用 Telnyx 托管的专属 A100/H100 资源。端到端 P99 延迟稳定在 420ms(16K tokens 输入 + 512 tokens 输出),吞吐 18 tokens/sec。架构完全公开:MoE 结构含 128 个专家,每次激活 8 个;支持 FP16+INT8 混合量化;上下文窗口 2M tokens;训练数据全部标注来源。MMLU、CMMLU、GSM8K、BenchBee 基准测试结果已公开,非蒸馏、非裁剪,全量可审计、可复现、可商用。

权重即交付

Kimi K3 发布完整 model.safetensors 文件、tokenizer.jsonconfig.json,以及 MoE 路由逻辑(top_k=8)。不同于只放小模型或缺推理脚本的“半开源”,Moonshot 提供了适配 Hugging Face Transformers v4.45+ 的 KimiForCausalLM 类,并验证兼容 vLLM 0.6.3 和 TensorRT-LLM 0.12。

Telnyx API 完全兼容 OpenAI Chat Completions 格式(/v1/chat/completions):Header 传 Authorization: Bearer <telnyx_api_key> 即可调用,不依赖 SDK。一个 curl 命令就能跑通 2.8T 模型——省掉集群部署、模型切分、KV Cache 优化和重试熔断等至少三周工程投入。

Telnyx:轻资产出海通道

Telnyx 推理平台专为 LLM 低延迟、高并发设计:GPU 资源独占(非共享租户)、节点内 NVLink 直连(A100×8 或 H100×4)、内置动态批处理(max_batch_size=32)与请求优先级队列。

实测 50 QPS 持续压测下,token 生成抖动标准差仅 ±17ms,优于同等规模模型在 AWS SageMaker 或 GCP Vertex 上的公开 benchmark。合规方面,Telnyx 已通过 SOC 2 Type II 和 GDPR 认证,API 流量默认不落盘、不用于训练,满足金融、医疗等强监管行业对调用链路的审计要求。这是国产超大模型首次绕过自建算力墙,直接嵌入全球 SaaS 生态的技术接口。

2M 上下文:真实可用,不是参数游戏

Kimi K3 的 2M tokens 上下文不是营销话术。技术博客披露其采用分块注意力(Block-Sparse FlashAttention-3 变体)+ 外存 KV Cache 管理方案:单次推理最多加载 1.2M tokens 到显存(H100 80GB),剩余 800K tokens 存于高速 NVMe 缓存,访问延迟 8.3μs。

对比 Llama-3.1-405B 的 128K 上下文,K3 在长文档摘要(如 500 页 PDF 解析)、法律合同比对、多轮对话状态追踪等场景有代际优势。实测处理 1.8M tokens 输入时:首 token 延迟 1.2s,后续 token 平均间隔 39ms——逼近本地 H100 单卡部署极限,证明工程优化深度远超参数规模本身。

👉 Binance · OKX · Gate.io · HTX · Bitget

基准可复现,不是选择性公布

所有评测细节公开:

  • MMLU:5-shot 零样本设置(未用 chain-of-thought 微调)
  • CMMLU:严格按原始 prompt 模板
  • GSM8K:统一采样策略 --temperature=0.3 --top_p=0.95

全部测试在 Telnyx 托管实例上完成,结果与本地复现误差 <0.4%。评估 pipeline 脚本已开源(GitHub repo: moonshot-ai/k3-bench),覆盖数据清洗、prompt 注入、输出解析、score aggregation 全流程。“把 benchmark 当产品做”,终结国产模型长期存在的“榜单分数不可验证”困局。

对工程师和创业者的实际价值

如果你在构建智能客服、代码助手或垂直领域知识引擎:现在可跳过模型微调、部署、扩缩容环节,直接用 Telnyx API 接入 2.8T 国产模型。

计费:$0.00012/token(输入) + $0.00028/token(输出)。一次 1000 tokens 请求成本约 $0.08,比同等能力闭源 API 低 37%。

快速验证:

curl -X POST https://api.telnyx.com/v1/chat/completions \
  -H "Authorization: Bearer ${KEY}" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "..."}]
  }'

替换为你自己的 prompt,观察长上下文下的稳定性。国产大模型不必再自己扛 GPU,该专注定义场景、打磨体验——这才是真正的生产力拐点。

返回首页