Audio-guided articulatory distillation for multilingual visual speech recognition with large language model decoding
An audio-guided distillation framework for multilingual VSR that exploits synchronized audio-visual speech during training while preserving visual-only inference is introduced, and results further confirm the contribution of LLM decoding, teacher initialization, and audio-guided distillation to visual-only recognition performance.