01
从“全部保留”转向“重要性驱动”
这项系统方案尝试把知识检索、文档重排、Chunk 切分、重要片段筛选与动态缓存分配放在同一条链路中。核心问题不只是如何压缩,而是如何判断哪些上下文值得持续占用缓存。当前阶段为方案设计,而非已完成的端侧实现。
02
结果必须绑定测试口径
ChunkKV 等参考工作为片段选择与跨层复用提供了思路。交底材料中的性能预期来自参考文献与方案分析,不是个人独立测量的结果,也不能把服务器 GPU 上的表现直接等同于端侧效果。
03
下一步:把质量损失纳入同一张表
缓存策略不能只追求显存与速度。更完整的评估还需要同时观察任务质量、首 token 延迟、吞吐、峰值显存和不同上下文长度下的稳定性。
从技术笔记回到完整案例
查看项目与验证范围