01

背景与个人贡献

面向端侧资源受限场景,探索如何将检索、语义片段选择和缓存调度协同设计。相关发明专利申请号 CN202610081890.6,审中状态依据个人申请信息;本页不将方案指标或参考文献结果表述为个人实测。

  • 主要负责组合检索、片段重要性与缓存调度的系统方案设计。
  • 梳理模块之间的输入、输出与资源约束,编写相关技术交底材料。
  • 区分既有方法与系统组合设计,明确后续性能和质量验证的条件。
02

系统流程

  1. 01
    检索与重排

    筛选相关上下文

  2. 02
    片段组织

    保留语义邻接

  3. 03
    重要性评估

    分配片段优先级

  4. 04
    预算分配

    选择保留缓存

  5. 05
    跨层复用

    减少重复选择

  6. 06
    质量与成本

    联合验证策略

03

设计取舍

压缩的对象,不只是孤立 Token

参考 ChunkKV 等已有工作,以连续片段为单位考虑上下文保留。设计重点是将检索信号和语义片段组织接入缓存选择,而非将基础算法全部视为个人原创。

缓存预算必须与回答质量一起看

更多淘汰可能减少缓存占用,却也可能丢失回答所需证据。因此系统方案同时考虑片段相关性、上下文完整性与资源预算,不能仅以压缩比例判断优劣。

“面向端侧”不等于“已经端侧实测”

设计中的保留策略、重要性评分和跨层复用都需要固定模型、硬件、序列长度及基线后验证。参考论文中的 GPU 结果不能直接外推到端侧设备。

04

验证计划 · 非实测结果

本案例展示系统设计,没有可公开的实现与基准记录,因此不提供运行截图或性能曲线。

先固定可比较的实验条件

  1. 固定模型、设备、精度、批大小以及输入/输出长度。
  2. 建立 Full KV 基线,并在同一任务集上比较不同缓存预算。
  3. 记录任务质量、首 Token 延迟、生成吞吐、峰值显存与 KV 占用。

只有质量与成本在同一口径下测量,才能判断方案的实际收益。

05

验证与下一步

当前验证范围

  • 当前证据为技术交底材料与个人设计贡献说明,尚不能证明独立实现或端侧实验已完成。
  • 方案中引用的性能预期来自参考文献与设计分析,不作为本站的个人量化成果。

下一步

  • 补充专利受理/审查材料,以核对申请的具体进度。
  • 完成最小可复现实验,并公开可分享的配置、基线及质量—资源权衡结果。
参考方法:ChunkKV 原论文

继续读这项工作的技术笔记

阅读相关笔记