Skip to content

Efficiently Maintaining the Multilingual Capacity of MCLIP in Downstream Cross-Modal Retrieval Tasks

2025 · Neural Information Processing Systems · pp. 111505-111526 · 2 citations · 32 references
Computer Science

TL;DR

This work systematically investigates the role of token similarity in cross-lingual transferability for image-text retrieval, establishing it as a key factor governing fine-tuning efficacy in MCLIP, and proposes two novel strategies to enhance efficiency while preserving multilinguality.

Abstract

While existing research on Multilingual CLIP (MCLIP) has prioritized model architecture design, our work uncovers a critical challenge in practical adaptation: fine-tuning MCLIP through a single source language risks diminishing its multilingual capabilities in downstream tasks due to cross-linguistic disparities. To bridge this gap, we systematically investigate the role of token similarity in cross-lingual transferability for image-text retrieval, establishing it as a key factor governing fine-tuning efficacy. Building on this insight, we propose two novel strategies to enhance efficiency while preserving multilinguality: 1) TaPCL dynamically optimizes training by prioritizing linguistically distant language pairs during corpus sampling, reducing redundant computation, and 2) CiPCL enriches the source corpus with multilingual key terms, enabling targeted knowledge transfer without reliance on exhaustive parallel data. By strategically balancing token similarity and domain-critical information, our methods significantly lower computational costs and mitigate over-dependence on parallel corpora. Experimental evaluations across diverse datasets validate the effectiveness and scalability of our framework, demonstrating robust multilingual retention across languages. This work provides a principled pathway for adapting MCLIP to real-world scenarios, where computational efficiency and cross-lingual robustness are paramount. Our codes are available at https://github.com/tiggers23/TaPCL-CiPCL .

View source

Similar papers

Open access Aug 2026

Optimizing Multilingual Embedding Models for Retrieval and Reranking in RAG Pipelines: Enhancing Semantic Search in Turkish Medical Datasets

The findings indicate that domain-specialized models improve in-domain retrieval relative to generic models, and that systematic optimization through the multi-stage pipeline yields measurable gains in retrieval precision.

Savaş Yıldırım, Mucahit Cevik, Ayşe Başar · 0 citations
#artificial intelligence Preprint Sep 2026

Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning

Large Language Model (LLM) unlearning aims to suppress target knowledge while preserving general capabilities. In multilingual settings, unlearning must additionally propagate within its intended linguistic scope. However, existing evaluations mainly measure cross-lingual transfer and cannot distinguish insufficient fr...

Pengyang Shao, Chuanpeng Lu, Wei Qin et al. · 0 citations
#small language model Preprint Aug 2026

Dataset Scarcity Limits Robust Evaluation of Multilingual Embedding Models: A Case Study of Slavic Languages

A two-dimensional framework, specifically tailored for analyzing multilingual embedding benchmarks under dataset scarcity, is proposed and applied on the Slavic-language subset of the MTEB benchmark, revealing severe benchmark sparsity.

Ana Gjorgjevikj, B. Seljak, T. Eftimov · 0 citations
Book Open access Aug 2026

Semantic-Symbolic Knowledge Consensus for Multilingual Question Answering

Multilingual Question Answering (MQA) is primarily characterized by semantic-based and symbolic-based approaches, remain constrained by Language Confinement. Semantic methods, such as RAG and Agentic frameworks, suffer from linguistic bias that restricts retrieval and reasoning to the source language, while symbolic ap...

Yu Zhang, Ran Song, Xiaofei Gao et al. · 0 citations
Preprint Aug 2026

Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation

Task-Conditional Flow Matching (TCFM), a multilingual embedding adaptation framework that selectively applies Flow Matching to translation tasks while optimizing retrieval, classification, and pair-classification tasks with objectives better aligned to their learning dynamics, is introduced.

T. Bhatt, S. NarenKumar, Mayank Singh · 0 citations
Preprint Aug 2026

Disentangled Contrastive Learning for Zero-Shot Multilingual Dense Retrieval

Multilingual dense retrieval aims to handle queries and documents across different languages based on a unified retriever model. The challenge lies in enabling robust retrieval transfer to low-resource languages where annotated retrieval data is often scarce. Although previous studies transfer high-resource supervision...

Chao Huang, Yufeng Chen, Changhao Guan et al. · 0 citations

We use cookies to run the site and, with your consent, for analytics and to show ads. See our Cookie Policy.