研究

我们的研究围绕一个问题:端侧模型交付之后,如何继续学习?Neural Imprint 是我们的答案;下面的推理效率研究则让它能在手机和 PC 上运行,覆盖 Apple 与 Intel 两大芯片平台。每项研究都为某个真实产品解锁能力。

Neural Imprint · 论文

Neural Imprint:与用户一同成长的模型——不更新权重的端侧 AI 进化

我们关于端侧持续学习的论文。不同于更新权重(微调)或每轮重新注入文本(RAG),Neural Imprint 从本地行为数据中蒸馏出一份紧凑的用户表示,并将其持久化为可跨会话恢复的推理状态。基座权重保持冻结,数据不离开设备,每份状态都可验证、可即时回滚。

  • ▶在 8 个应用领域、2 种模型规模(Qwen3.5-4B / 9B)和 2 台 iPhone 上验证,使用合成行为数据(3,283 条记录)
  • ▶16/16 A-library 健康门控通过(8 领域 × 2 模型规模)
  • ▶16/16 个性化画像回答零工具调用完成;16/16 工具自主调用正确
  • ▶完整流水线运行于消费级 iPhone 的 6 GB 内存上限之内,零云端依赖
  • ▶手稿(2026)——全文暂未公开
证据
Intel · OpenVINO

Intel 平台上的端侧语音与 9B 对话:从 Apple 迁移的流式引擎

把为 Apple 芯片构建的流式语音引擎迁移到 Intel Core Ultra(CPU + Arc 核显),基于 OpenVINO 自研推理运行时;语音识别、9B 大模型与语音合成同机常驻,已两次交付世界头部 PC 整机制造商。

  • ▶有状态流式声码器:0.4 秒分块解码,逐块与整句输出信噪比 115.9–116.4 dB
  • ▶开始出声 0.37 秒,语音合成实时率 0.73;开源参考实现 15–20 秒、2.1–2.9
  • ▶NI 学习状态在 OpenVINO 上保存与恢复:9B 首 token 0.97 → 0.45 秒(同内容)
  • ▶拆分预测器、CPU 与核显流水线;30 分钟连续合成 357/357 句完整
技术文章
MLXLayerStream

按层流式卸载:在 8GB 边缘设备上运行 9B+ 大模型

通过从 NVMe 存储按层流式加载权重,使超出设备内存的模型能在 iPad 和 iPhone 上推理。88% 峰值内存减少,带宽缩放在 Apple Silicon 设备上得到验证。

  • ▶60–88% 内存减少:27B 模型仅需 1.7 GB 峰值内存即可运行
  • ▶9B-6bit 在 8GB iPad 上 OOM 证明所有 9B+ 模型都需要流式加载
  • ▶iPad/iPhone TPS 比值 = 1.92x 完美匹配 2x 带宽比
GitHub
speculative-moe-research

推测解码对混合专家模型有帮助吗?

306 次实验的实证研究表明,尽管草稿接受率低于 4%,推测解码仍能为 Qwen3.5-35B-A3B MoE 模型提供 1.18–1.30× 加速,其机制是批量验证摊销减少了内存带宽开销。

  • ▶0.8B 草稿模型在 γ=16 时实现 1.30× MoE 加速,接受率仅 0.2%
  • ▶加速与总参数量(内存带宽)而非活跃参数量成正比
  • ▶批量验证摊销:超越接受率的新 SD 加速机制
GitHub
apple-silicon-llm-inference

Apple Silicon 端侧 LLM 推理:从量化到投机解码

对 Qwen3.5 在三台 Apple Silicon 设备(M2 Ultra、M1 Max、M2 Pro)上的 7 种 GGUF 量化级别和投机解码进行系统性基准测试,确立 Q6_K 为 Pareto 最优选择,≥2.5× 草稿/目标速比为 SD 可行性阈值。

  • ▶Q6_K Pareto 最优:速度提升 1.68 倍,体积缩小 59%,PPL 损失 0.54%
  • ▶投机解码吞吐量提升 +25.7%(0.8B→9B,k=4)
  • ▶GGML_RPC 跨设备 SD:79% 开销——不适合生产部署
GitHub
Prism

消费级硬件上的跨域个人数据整合

在消费级 Apple Silicon 上整合财务、饮食、情绪和阅读数据,产生涌现式跨域洞察,零数据泄漏。

  • ▶1.48x 跨域洞察涌现增量 (IIR)
  • ▶125.5x 联邦压缩比,零数据泄漏
  • ▶49.9 TPS 实时推理 (35B on M2 Ultra)
GitHub
hybrid-batch-prefill-on-ane

ANE 批量预填充实现端侧并行 LLM 推理

通过融合批量矩阵-向量内核,在 Apple Silicon 上实现 ANE 预填充与 GPU 解码并发执行,批量调度吞吐量提升 11.3 倍。

  • ▶批量调度加速 11.3 倍 (268 tok/s)
  • ▶并发管线功耗降低 79%
  • ▶多轮对话 TTFT 仅 27ms
GitHub
hybrid-ane-mlx-bench

Apple Silicon 上的分离式 LLM 推理

基准测试 CoreML ANE 预填充 + MLX GPU 解码,在 Apple Silicon 上对比四种 Qwen3.5 推理策略。

  • ▶ANE 预填充在约 410 token 处追平 GPU
  • ▶预填充阶段 GPU 功耗降低 282 倍
  • ▶4 种推理管线全面基准测试
GitHub
swift-qwen3-tts

端侧文本转语音

Qwen3 TTS 0.6B 的原生 Swift 实现,支持实时端侧语音合成。

  • ▶67% 模型压缩 (2.35 GB → 808 MB)
  • ▶实时合成 (RTF 0.68x)
  • ▶支持 12 种语言
GitHub
Gemma-Prune

端侧视觉语言模型

多阶段压缩管线,将 Gemma 3 4B VLM 部署到消费级硬件。

  • ▶25% 模型压缩 (2.8 GB → 2.1 GB)
  • ▶110 tok/s 文本生成
  • ▶3.4x 图像处理加速
OptMLX

MLX 内存优化研究

探索 Apple Silicon 上 MLX 框架的内存优化技术。

  • ▶mmap 加载速度提升高达 20 倍
  • ▶零拷贝模型加载
  • ▶全面的性能基准测试
GitHub