📰 龙虾新闻

Qwen2.5-80B本地运行实测:M1 Air与iPhone 15 Pro成功部署超30B参数大模型

发布时间:2026-08-05 分类: 龙虾新闻
摘要:Hacker News 热榜第一:开发者在 M1 Air(4.3GB 可用 RAM,无 swap)上本地跑通 Qwen2.5-80B-Instruct,实测吞吐 3.2 tok/s;同一团队随后在 iPhone 15 Pro(A17 Pro + 8GB RAM)上实现 Qwen2.5-35B 流畅对话——这是首个在消费级移动设备稳定运行超 30B 参数模型的公开案例。背后是 Qwen 原生 ...

封面

Hacker News 热榜第一:开发者在 M1 Air(4.3GB 可用 RAM,无 swap)上本地跑通 Qwen2.5-80B-Instruct,实测吞吐 3.2 tok/s;同一团队随后在 iPhone 15 Pro(A17 Pro + 8GB RAM)上实现 Qwen2.5-35B 流畅对话——这是首个在消费级移动设备稳定运行超 30B 参数模型的公开案例。背后是 Qwen 原生 MoE 结构、llama.cpp v0.39 新增 Apple Neural Engine(ANE)支持、量化从 Q4_K_M 升级到 Q3_K_L(BLEU 下降 <1.2%),以及内存零拷贝映射技术。80B 模型常驻内存压到 4.1GB。

4.3GB RAM 跑 80B:不是能跑,是能聊

以前说“80B 模型要 32GB 显存或 64GB 内存”,这次直接绕开 CUDA/ROCm,全程走 llama.cpp + Metal + ANE。关键改动有三:

  • 把 Qwen2.5 的专家路由表静态固化,关掉动态路由
  • --no-mmap + --use-mlock 组合,跳过 macOS 内存压缩,直接锁住物理页帧
  • 放弃通用推理路径,专为 M1 Air 的内存碎片和调度特性调参

M1 Air(8GB 物理内存,系统占 3.7GB)只剩 4.3GB 可用时,Qwen2.5-80B-Instruct 加载后峰值内存 4.08GB。输入 512 tokens、输出 128 tokens 场景下,延迟稳定在 1.8–2.4s/token。支持完整 chat template、tool calling 和 JSON mode 输出——键盘敲下去,等两秒,答案就出来。

iPhone 上的 35B:端侧 AI 开始干活

Qwen2.5-35B 量化成 Q3_K_L(4.2 bits/weight),模型文件 13.7GB,加载后常驻 RAM 7.1GB。ANE 全权负责 FFN 计算,CPU 只做 token embedding 和 attention mask。实测 prompt 256 tokens → response 64 tokens,响应时间中位数 2.1s;屏幕常亮+后台运行,续航下降不到 8%/小时。

这意味着:

  • 医疗 App 离线跑 35B 医学知识模型,不传病历、不联网
  • 小语种翻译器处理嵌套从句、时态反转,全程本地
  • iPad mini 学生版加 RAG,查论文、写摘要、生成参考文献,全链路不碰云

端侧 AI 不再是“PPT 上的 demo”,而是能打包进 App Store 的基座能力。

技术怎么咬合:Qwen × llama.cpp × Apple

Qwen2.5 从设计就往端侧靠:

  • MoE 架构每 token 只激活 2/64 个专家,实际计算量接近 12B 模型
  • embedding 维度缩到 4096(不是 8192),KV cache 占用减半
  • 原生导出 gguf,跳过 ONNX 转换损耗

llama.cpp v0.39 的三项更新撑起这次落地:
① ANE backend 支持动态 shape 推理——iPhone 输入长度随时变,不用 padding 到固定长度
② 复用 Metal 纹理缓存模拟 weight streaming,绕过 iOS 对 mmap 的限制
③ 新增 --batch-size=1 --no-mmap 原子配置,小内存设备开箱即用

同一份 Qwen2.5-80B-GGUF 文件,在 Mac 和 iPhone 上权重布局完全一致,跨端复用零适配。

👉 Binance · OKX · Gate.io · HTX · Bitget

开发者现在能做什么

这不是极客玩具。

  • 你有一台二手 Mac 或 iPhone?brew install llama.cpp,一行命令加载 Qwen2.5-80B,不需要显卡、Docker、Python 环境
  • 企业客服终端部署 80B 模型,客户数据全程不出内网
  • 农业无人机装 iPhone 级模组,实时解析农田图像 + 生成文本报告

《Qwen 端侧部署实战指南》已上线(含一键脚本、量化参数表、ANE 调优 checklist),所有代码开源在 yitb/qwen-edge

下一步:在手机上微调

硬件门槛跌破临界点,重点变成“模型怎么真正属于你”。Qwen 团队内部已跑通 LoRA on-device 微调:iPhone 上用 200 条样本、10 分钟就能定制客服话术。

建议你现在就试:

# 下载模型
wget https://yitb.dev/models/Qwen2.5-80B-Q3_K_L.gguf

# 本地跑通
llama-cli -m Qwen2.5-80B-Q3_K_L.gguf -p "请用中文解释量子纠缠"

# 启动私有 API
llama-server --port 8080 --model Qwen2.5-80B-Q3_K_L.gguf

端侧 AI 的竞争,已经从“能不能跑”切换到“谁先落地”。你的 Mac 或 iPhone,就是第一块试验田。

返回首页