01
背景与个人贡献
面向端侧资源受限场景,探索如何将检索、语义片段选择和缓存调度协同设计。相关发明专利申请号 CN202610081890.6,审中状态依据个人申请信息;本页不将方案指标或参考文献结果表述为个人实测。
- 主要负责组合检索、片段重要性与缓存调度的系统方案设计。
- 梳理模块之间的输入、输出与资源约束,编写相关技术交底材料。
- 区分既有方法与系统组合设计,明确后续性能和质量验证的条件。
02
系统流程
- 01检索与重排
筛选相关上下文
- 02片段组织
保留语义邻接
- 03重要性评估
分配片段优先级
- 04预算分配
选择保留缓存
- 05跨层复用
减少重复选择
- 06质量与成本
联合验证策略
03
设计取舍
压缩的对象,不只是孤立 Token
参考 ChunkKV 等已有工作,以连续片段为单位考虑上下文保留。设计重点是将检索信号和语义片段组织接入缓存选择,而非将基础算法全部视为个人原创。
缓存预算必须与回答质量一起看
更多淘汰可能减少缓存占用,却也可能丢失回答所需证据。因此系统方案同时考虑片段相关性、上下文完整性与资源预算,不能仅以压缩比例判断优劣。
“面向端侧”不等于“已经端侧实测”
设计中的保留策略、重要性评分和跨层复用都需要固定模型、硬件、序列长度及基线后验证。参考论文中的 GPU 结果不能直接外推到端侧设备。
04
验证计划 · 非实测结果
本案例展示系统设计,没有可公开的实现与基准记录,因此不提供运行截图或性能曲线。
先固定可比较的实验条件
- 固定模型、设备、精度、批大小以及输入/输出长度。
- 建立 Full KV 基线,并在同一任务集上比较不同缓存预算。
- 记录任务质量、首 Token 延迟、生成吞吐、峰值显存与 KV 占用。
只有质量与成本在同一口径下测量,才能判断方案的实际收益。
05
验证与下一步
当前验证范围
- 当前证据为技术交底材料与个人设计贡献说明,尚不能证明独立实现或端侧实验已完成。
- 方案中引用的性能预期来自参考文献与设计分析,不作为本站的个人量化成果。
下一步
- 补充专利受理/审查材料,以核对申请的具体进度。
- 完成最小可复现实验,并公开可分享的配置、基线及质量—资源权衡结果。
继续读这项工作的技术笔记
阅读相关笔记