Octopus提出了一种基于无历史数据的梯度正交化(HiFGO)的两阶段持续学习框架,通过梯度层面的正交约束有效缓解了任务间的干扰,同时提出两阶段训练策略实现可塑性与稳定性的良好平衡。Octopus在UCIT基准上实现了当前最优性能(SOTA),Avg和Last指标分别超越现有最优方法 2.14% 和 6.82%。 作者: vivo BlueImage Lab本文入选 CVPR 2026CVPR(IEEE Conference on Computer Vision and Pattern Recognition)IEEE国际计算机视觉与模式识别会议,主要内容是计算机视觉与模式识别技术。CVPR 2026约160920篇投稿,接收率约25.42%。 论文主页:https://arxiv.org/abs/2605.14938 代码仓库:https://github.com/Fxmangd/Octopus 摘要:多模态大语言模型的持续学习旨在序贯式获取知识并缓解灾难性遗忘问题,现有方法通常在推理开销、泛化性以及隐私保护方面存在固有局限。Octopus提出了一种基于无历史数据的梯度正交化(HiFGO)的两阶段持续学习框架,通过梯度层面的正交约束有效缓解了任务间的干扰,同时提出两阶段训练策略实现可塑性与稳定性的良好平衡。Octopus在UCIT基准上实现了当前最优性能(SOTA),Avg和Last指标分别超越现有最优方法 2.14% 和 6.82%。 图表1 Octopus与现有方法在 UCIT 数据集上的性能对比 在通往通用人工智能(AGI)的道路上,如何让多模态大语言模型(MLLM)具备持续学习(Continual Learning) 的能力,且不发生灾难性遗忘(Catastrophic Forgetting),是当前最具挑战的课题之一。 传统持续学习方法往往陷入两难困境:基于数据重放的方法高度依赖历史任务数据,不仅会带来存储开销,更引发了严重的数据隐私与安全隐患;基于架构的方法则会随着任务增加不断引入额外的模型参数,导致泛化能力受限与推理成本激增。基于正则化的方法虽无需存储历史数据且不增加推理成本,但现有技术在“学习新知识(可塑性)”和“保留旧知识(稳定性)”之间往往难以达到理想的平衡。 为破解这一难题,近日,上海交通大学与vivo团队联合提出了一种全新的持续学习框架——Octopus。该方法首创 无需历史数据的梯度正交化(History-Free Gradient Orthogonalization, HiFGO) 技术。模型无需获取任何历史任务数据,即可精准捕捉不干扰旧知识的“安全更新方向”, 精准刻画并规避任务间的参数干扰。 实验表明,在权威的多模态增量学习基准UCIT上,Octopus的平均性能(Avg)和最终性能(Last)分别超越此前SOTA方法 2.14% 和 6.82%,并且在不依赖旧数据的情况下罕见地实现了“正向后向迁移(Positive Backward Transfer)”。 一、背景:大模型的“灾难性遗忘”困境 近年来,多模态大模型(MLLM)在各项任务中展现出卓越的性能。但在实际业务部署中,模型需要像人类一样进行“终身学习”——不断掌握新技能并适应新数据分布。然而,当大模型在新数据上进行微调时,参数的更新往往会不可逆地抹除模型先前学到的旧知识,引发“灾难性遗忘”。 目前主流的 MLLM 持续学习方法存在难以逾越的瓶颈: 基于架构的方法(Architecture-based):为每个任务分配特定的 LoRA 模块以存储任务专属信息。虽然能缓解遗忘,但会割裂任务间的知识共享,削弱模型对未知任务的泛化能力,并降低推理阶段的计算效率。 基于重放的方法(Rehearsal-based):通过维护记忆模块存储历史任务信息。但在实际应用(尤其在端侧设备)中,历史数据往往涉及隐私或不可获取;同时,维护经验回放缓冲区也会带来额外的存储开销。 基于正则化的方法(Regularization-based):通过添加约束项限制参数更新的范围。然而前沿研究表明,现有方法所依赖的 “参数空间正交”并不足以完全防止知识干扰,且难以在“学习新知识(可塑性)”和“保留旧知识(稳定性)”间找到最佳平衡。 这引出了一个核心问题:是否存在一种方法,既不需要访问历史数据,也不增加推理阶段的参数负担,同时还能高效保留模型的旧知识? Octopus 的核心洞悉正源于此:仅在参数层面进行正交约束是局限的,梯度层面的正交才是避免参数冲突的关键。更重要的是,研究团队证明了在缺乏旧数据的情况下,依然可以推导出这一“安全更新方向”。 […]