CodeX记忆系统大更新
CodeX记忆系统大更新Codex用着用着就要压缩上下文、压着压着可能还“失忆”的痛苦,就要结束了!
搜索
Codex用着用着就要压缩上下文、压着压着可能还“失忆”的痛苦,就要结束了!
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。
功能型SSD在这条数据链中的合理角色,不是自行判断一段经历是否值得记住,而是在Runtime已经给出对象和策略后,靠近数据执行确定性工作。例如按租户选择密钥,按生命周期放置数据,压缩与去重可缩减的对象,维护索引页与元数据,优先完成即将被推理使用的回载,并把尾延迟、写放大和介质健康反馈给上层。语义决策留在Agent和Runtime,数据执行尽量靠近介质。
LightX2V团队面向Wan2.2-A14B推出LightWan2.2-A14B,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。
长视频理解,正在成为多模态大模型的重要能力。
采访中,吴英成把自己正在做的事压缩成一句话:“上一代 AI 蒸馏的是互联网,下一代 AI for Science 应该‘蒸馏地球’。”
市面上已有几十种Agent记忆方案,有的基于向量检索,有的基于知识图谱,有的靠定期总结“压缩”对话,有的则完全依赖模型自身的上下文窗口。它们各有各的说法,但在系统层面,到底哪种方案靠得住?哪种方案在你的工作负载下既不贵又准?
现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。
以前:搜 Google → 开 8 个标签页 → 对比功能 → 约演示 → 买。现在:搜那个默认大牌 → 再搜「某某大牌 的替代品」→ 从冒出来的 3 个名字里挑一个 → 约演示 → 买。整条对比研究,被 AI 一次答复压缩成了「三选一」
如果我们谈到 AI 赋能带来的科学突破,AlphaFold 一定是不可忽略的一项。它解决了困扰生物学界半个多世纪的蛋白质折叠难题,大量压缩了得到蛋白质结构的时间,从原来的一年,到现在的几分钟。它的核心开发者之一 John Jumper 也因这一贡献在 2024 年摘得诺贝尔化学奖。