LatentPress 提出第三种上下文载体:连续 memory tokens。小 writer(约 4.2M–26.2M 参数适配器,约等于解码器 0.1%)把对话史与长文档压成 4–16×,冻结 decoder 经输入嵌入接口直接读取,推理时无需重建文本。LongMemEval 上 7.70× 压缩准确率 0.504,高于未压缩证据 0.490,并明显优于文本摘要与 OCR 压缩;写入约 43ms/会话,读取比原始上下文快 5–9×,利于长上下文智能体记忆。

核心要点速览 (Key Takeaways)

  • ✓表示:连续 memory tokens,冻结 LLM 经嵌入接口直读,无需重建文本。
  • ✓压缩:4–16×;LongMemEval 7.70× 时准确率 0.504,高于未压缩 0.490。
  • ✓效率:写入约 43ms/会话,读取比原始上下文快 5–9×,适配长上下文智能体。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算