研究 · 证据卡
Neural Imprint — 证据
- 对象
- 基于 Neural Imprint 的端侧学习,及其依赖的运行时。六项评估,全部在自有设备上完成。
- 模型
- Qwen3.5-4B · Qwen3.5-9B
- 设备
- iPhone Air · iPhone 17e · iPhone 17 Pro · iPad Air M3
- 数据
- 模拟个人记录:8 个生活领域共 3,283 条。真实记录:一人 112 条。
- 公开
- 原理、边界、评估结果。
- 不公开
- 学习状态的内部结构、激活规则、阈值、配方、原始对话。
1总览
| # | 评估 | 设备 | 模型 | 数据 | 结果 |
|---|---|---|---|---|---|
| E1 | 靠学习状态作答 · 精确数字查询 | iPhone 17e · iPhone 17 Pro | 9B 4-bit | 模拟,3,283 条 | 16/16 · 16/16 |
| E2 | 学习状态一致性检查 | Mac, Apple Silicon(主机侧) | 4B 6-bit · 9B 4-bit | 模拟,8 领域 | 16/16 |
| E3 | 真实记录提炼画像 | iPhone Air | 4B 6-bit | 真实,112 条,一人 | 48.5 s · 5/5 |
| E4 | 200 轮长会话 | iPhone Air · iPhone 17 Pro | 9B 4-bit | — | 200/200 · 200/200 |
| E5 | 边界 | iPhone Air · iPad Air M3 | 9B 4-bit | — | 100/100 @ 2,048 · 262,144 ctx |
| E6 | 压缩 · 精确事实召回 | iPad Air M3 | 9B 4-bit | — | 4/4 → 2/4 · 5/5 |
2学习
E1靠学习状态作答 · 精确数字查询
| 设备 | iPhone 17e (A19) · iPhone 17 Pro (A19 Pro) |
|---|---|
| 模型 | Qwen3.5-9B,4-bit |
| 数据 | 模拟个人记录,12 个月,3,283 条 |
| 领域 | 记账 · 健康 · 阅读 · 日记 · 旅行 · 做饭 · 音乐 · 工作 |
| 画像问题,靠学习状态作答 | 16/16 · 0 次查询 · 10.2–17.5 s |
| 精确数字问题,查询 | 16/16 调用正确工具并返回结果 |
| 对照:同一模型,无学习状态 | 0/16 在时限内完成 |
模拟数据,非真实用户。 · 未设“有查询工具、无学习状态”的第三组;查询行为不单独归因于学习状态。
E2学习状态一致性检查
| 机器 | Mac, Apple Silicon · 检查在生成学习状态的主机上完成,之后才装入手机 |
|---|---|
| 模型 | Qwen3.5-4B 6-bit · Qwen3.5-9B 4-bit |
| 数据 | 与 E1 相同的 8 个模拟领域 |
| 检查项 | 特征彼此区分 · 每个特征有信号 |
| 结果 | 16/16 通过(8 领域 × 2 模型规模) |
衡量学习状态的内部一致性,不衡量回答质量。 · 及格线固定;不公开。
E3真实记录提炼画像
| 设备 | iPhone Air |
|---|---|
| 模型 | Qwen3.5-4B,6-bit |
| 数据 | 112 笔真实消费记录,一人 |
| 提炼耗时 | 48.5 s |
| 选出的画像分量 | 5 |
| 参考行为核验 | 5/5 通过 |
一人;不能推及其他用户。 · 记录内容不公开。
3运行时
E4200 轮长会话
| iPhone Air | iPhone 17 Pro | |
|---|---|---|
| 设备级别 | 12 GB · A19 Pro | 12 GB · A19 Pro |
| 模型 | Qwen3.5-9B 4-bit | Qwen3.5-9B 4-bit |
| 负载 | 200 × 1,024 tokens | 200 × 1,024 tokens |
| 完成轮数 | 200/200 | 200/200 |
| 生成 token | 204,800 | 204,800 |
| 用时 | 7.06 h | 5.05 h |
| token/秒,平均 | 8.17 | 11.45 |
| token/秒,最低 | 7.23 | 10.31 |
| 峰值内存 | 5,501.6 MB | 5,505.7 MB |
| 内存增长,首轮至末轮 | +166.1 MB | +165.9 MB |
| 失败轮 · 内存溢出 | 0 · 0 | 0 · 0 |
每轮强制生成恰好 1,024 个 token;不评回答质量。
E5边界
| 工作点 | 1,024 tokens / 轮 · 见 E4 |
|---|---|
| 更高负载,100 轮,iPhone Air | 2,048 tokens / 轮 · 100/100 · 204,800 tokens · 峰值 5,299 MB · 0 OOM |
| 上下文上限 | 262,144 tokens · iPad Air M3 达到 261,425 后溢出 |
超过上限必须压缩或重开会话;内存平稳不能延长它。
E6压缩 · 精确事实召回
| 设备 · 模型 | iPad Air M3 · Qwen3.5-9B 4-bit |
|---|---|
| 完成轮数 | 72/72 |
| 开场埋入的事实 | 9 个:5 个名字与地点(一个人名、一个城市、三个代号)· 4 个精确数字(一个 token 数、一个设备数、一个条目数、一个日期) |
| 压缩发生在第 | 32 · 56 轮 |
| 第 28 轮回问,尚未压缩 | 5/5 名字与地点 · 4/4 精确数字 |
| 第 40 轮回问,压缩过 1 次 | 5/5 · 3/4(丢了日期) |
| 第 72 轮回问,压缩过 2 次 | 5/5 · 2/4(丢了日期;条目数被答成“约 12”) |
| 峰值内存 | 5,345.8 MB |
| token/秒,平均 | 8.83 |
| 对照运行,记忆窗口较小——第 72 轮回问 | 1/5 · 0/4 |
压缩后模型保留名称与地点,丢失精确数字与日期。精确事实需要通过本地工具或事实存储查询,不能只靠上下文记忆。 · 一台设备。
4验证中
| 项目 | 目前完成 | 完成条件 |
|---|---|---|
| 学习带来的回答质量提升 | 四组对照评估进行中;及格线在运行前锁定。 | 配对真机结果过线。 |
| 多用户 | 真实数据来自一人(E3)。 | 更多用户真实数据上的同口径评估。 |
| 非 Apple 芯片 | 六项评估均在 Apple 消费级硬件上。 | 其他芯片上的同口径评估。 |
| 用户纠正带来的模型改进 | 纠正链路已建成并审计;默认关闭。 | 上述对照评估通过后开启并评估。 |
5方法
- 01留出模型未见过的测试集。
- 02检查训练数据与测试集之间的泄漏。
- 03两台真实设备上配对运行。
- 04盲评。
- 05与运行前设定的及格线比较。
6来源
每项评估在内部保存为证据包:配置快照、原始日志、逐文件 SHA-256 校验和、设备级别、模型、软件版本。
不公开:原始对话、收据、真实记录。