研究 · 证据卡

Neural Imprint — 证据

对象
基于 Neural Imprint 的端侧学习,及其依赖的运行时。六项评估,全部在自有设备上完成。
模型
Qwen3.5-4B · Qwen3.5-9B
设备
iPhone Air · iPhone 17e · iPhone 17 Pro · iPad Air M3
数据
模拟个人记录:8 个生活领域共 3,283 条。真实记录:一人 112 条。
公开
原理、边界、评估结果。
不公开
学习状态的内部结构、激活规则、阈值、配方、原始对话。

1总览

#评估设备模型数据结果
E1靠学习状态作答 · 精确数字查询iPhone 17e · iPhone 17 Pro9B 4-bit模拟,3,283 条16/16 · 16/16
E2学习状态一致性检查Mac, Apple Silicon(主机侧)4B 6-bit · 9B 4-bit模拟,8 领域16/16
E3真实记录提炼画像iPhone Air4B 6-bit真实,112 条,一人48.5 s · 5/5
E4200 轮长会话iPhone Air · iPhone 17 Pro9B 4-bit200/200 · 200/200
E5边界iPhone Air · iPad Air M39B 4-bit100/100 @ 2,048 · 262,144 ctx
E6压缩 · 精确事实召回iPad Air M39B 4-bit4/4 → 2/4 · 5/5

2学习

E1靠学习状态作答 · 精确数字查询

设备iPhone 17e (A19) · iPhone 17 Pro (A19 Pro)
模型Qwen3.5-9B,4-bit
数据模拟个人记录,12 个月,3,283 条
领域记账 · 健康 · 阅读 · 日记 · 旅行 · 做饭 · 音乐 · 工作
画像问题,靠学习状态作答16/16 · 0 次查询 · 10.2–17.5 s
精确数字问题,查询16/16 调用正确工具并返回结果
对照:同一模型,无学习状态0/16 在时限内完成

模拟数据,非真实用户。 · 未设“有查询工具、无学习状态”的第三组;查询行为不单独归因于学习状态。

E2学习状态一致性检查

机器Mac, Apple Silicon · 检查在生成学习状态的主机上完成,之后才装入手机
模型Qwen3.5-4B 6-bit · Qwen3.5-9B 4-bit
数据与 E1 相同的 8 个模拟领域
检查项特征彼此区分 · 每个特征有信号
结果16/16 通过(8 领域 × 2 模型规模)

衡量学习状态的内部一致性,不衡量回答质量。 · 及格线固定;不公开。

E3真实记录提炼画像

设备iPhone Air
模型Qwen3.5-4B,6-bit
数据112 笔真实消费记录,一人
提炼耗时48.5 s
选出的画像分量5
参考行为核验5/5 通过

一人;不能推及其他用户。 · 记录内容不公开。

3运行时

E4200 轮长会话

iPhone AiriPhone 17 Pro
设备级别12 GB · A19 Pro12 GB · A19 Pro
模型Qwen3.5-9B 4-bitQwen3.5-9B 4-bit
负载200 × 1,024 tokens200 × 1,024 tokens
完成轮数200/200200/200
生成 token204,800204,800
用时7.06 h5.05 h
token/秒,平均8.1711.45
token/秒,最低7.2310.31
峰值内存5,501.6 MB5,505.7 MB
内存增长,首轮至末轮+166.1 MB+165.9 MB
失败轮 · 内存溢出0 · 00 · 0

每轮强制生成恰好 1,024 个 token;不评回答质量。

E5边界

工作点1,024 tokens / 轮 · 见 E4
更高负载,100 轮,iPhone Air2,048 tokens / 轮 · 100/100 · 204,800 tokens · 峰值 5,299 MB · 0 OOM
上下文上限262,144 tokens · iPad Air M3 达到 261,425 后溢出

超过上限必须压缩或重开会话;内存平稳不能延长它。

E6压缩 · 精确事实召回

设备 · 模型iPad Air M3 · Qwen3.5-9B 4-bit
完成轮数72/72
开场埋入的事实9 个:5 个名字与地点(一个人名、一个城市、三个代号)· 4 个精确数字(一个 token 数、一个设备数、一个条目数、一个日期)
压缩发生在第32 · 56 轮
第 28 轮回问,尚未压缩5/5 名字与地点 · 4/4 精确数字
第 40 轮回问,压缩过 1 次5/5 · 3/4(丢了日期)
第 72 轮回问,压缩过 2 次5/5 · 2/4(丢了日期;条目数被答成“约 12”)
峰值内存5,345.8 MB
token/秒,平均8.83
对照运行,记忆窗口较小——第 72 轮回问1/5 · 0/4

压缩后模型保留名称与地点,丢失精确数字与日期。精确事实需要通过本地工具或事实存储查询,不能只靠上下文记忆。 · 一台设备。

4验证中

项目目前完成完成条件
学习带来的回答质量提升四组对照评估进行中;及格线在运行前锁定。配对真机结果过线。
多用户真实数据来自一人(E3)。更多用户真实数据上的同口径评估。
非 Apple 芯片六项评估均在 Apple 消费级硬件上。其他芯片上的同口径评估。
用户纠正带来的模型改进纠正链路已建成并审计;默认关闭。上述对照评估通过后开启并评估。

5方法

  1. 01留出模型未见过的测试集。
  2. 02检查训练数据与测试集之间的泄漏。
  3. 03两台真实设备上配对运行。
  4. 04盲评。
  5. 05与运行前设定的及格线比较。

6来源

每项评估在内部保存为证据包:配置快照、原始日志、逐文件 SHA-256 校验和、设备级别、模型、软件版本。

不公开:原始对话、收据、真实记录。

返回研究