Skip to main navigation Skip to search Skip to main content

StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval

  • Shaokun Wang
  • , Weili Guan*
  • , Jizhou Han
  • , Jianlong Wu
  • , Yupeng Hu
  • , Liqiang Nie
  • *Corresponding author for this work
  • Harbin Institute of Technology Shenzhen
  • Shenzhen Loop Area Institute
  • Xi'an Jiaotong University
  • Shandong University

Research output: Chapter in Book/Report/Conference proceedingConference contributionpeer-review

Abstract

Continual Text-to-Video Retrieval (CTVR) is a challenging multimodal continual learning setting, where models must incrementally learn new semantic categories while maintaining accurate text-video alignment for previously learned ones, thus making it particularly prone to catastrophic forgetting. A key challenge in CTVR is feature drift, which manifests in two forms: intra-modal feature drift caused by continual learning within each modality, and non-cooperative feature drift across modalities that leads to modality misalignment. To mitigate these issues, we propose StructAlign, a structured cross-modal alignment method for CTVR. First, StructAlign introduces a simplex Equiangular Tight Frame (ETF) geometry as a unified geometric prior to mitigate modality misalignment. Building upon this geometric prior, we design a cross-modal ETF alignment loss that aligns text and video features with category-level ETF prototypes, encouraging the learned representations to form an approximate simplex ETF geometry. In addition, to suppress intra-modal feature drift, we design a Cross-modal Relation Preserving loss, which leverages complementary modalities to preserve cross-modal similarity relations, providing stable relational supervision for feature updates. By jointly addressing non-cooperative feature drift across modalities and intra-modal feature drift, StructAlign effectively alleviates catastrophic forgetting in CTVR. Extensive experiments on benchmark datasets demonstrate that our method shows competitive advantages over state-of-the-art continual retrieval approaches.

Original languageEnglish
Title of host publicationSIGIR 2026 - Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval
PublisherAssociation for Computing Machinery, Inc
Pages1800-1811
Number of pages12
ISBN (Electronic)9798400725999
DOIs
StatePublished - 19 Jul 2026
Externally publishedYes
Event49th International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR 2026 - Melbourne, Australia
Duration: 20 Jul 202624 Jul 2026

Publication series

NameSIGIR 2026 - Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

Conference

Conference49th International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR 2026
Country/TerritoryAustralia
CityMelbourne
Period20/07/2624/07/26

Keywords

  • continual learning
  • continual text-to-video retrieval
  • equiangular tight frame
  • non-cooperative feature drift.

Fingerprint

Dive into the research topics of 'StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval'. Together they form a unique fingerprint.

Cite this