# Language Discrimination Improves Linguistic Learning in Multilingual Speech Models

DevFeed: [Language Discrimination Improves Linguistic Learning in Multilingual Speech Models](<https://devfeed.tech/articles/language-discrimination-improves-linguistic-learning-in-multilingual-speech-models-64220.md>)

Original publisher: [Read original article](<https://machinelearning.apple.com/research/language-discrimination-multilingual-learning>)

Published: 2026-10-02T00:00:00Z

Content type: article

Language: en

Sources: [Apple Machine Learning Research](<https://devfeed.tech/sources/apple-machine-learning-research.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Open Source Models & Datasets](<https://devfeed.tech/topics/open-source-models-datasets.md>), [Whisper](<https://devfeed.tech/topics/whisper.md>)

Tags: [language](<https://devfeed.tech/tags/language.md>), [models](<https://devfeed.tech/tags/models.md>), [pretraining](<https://devfeed.tech/tags/pretraining.md>), [self-supervised-learning](<https://devfeed.tech/tags/self-supervised-learning.md>), [speech](<https://devfeed.tech/tags/speech.md>), [speech-processing](<https://devfeed.tech/tags/speech-processing.md>)

## AI overview

The paper studies how encouraging language discrimination during pretraining affects multilingual self-supervised speech models. In a controlled English/French HuBERT setting, an auxiliary language classifier and per-language k-means targets reduced phone discrimination error and improved lexical and prosodic scores, in some measures approaching or exceeding monolingual results. Introducing language discrimination in the first training iteration produced the strongest gains, while later or repeated interventions brought smaller improvements and greater language-wise segregation.

## Source excerpt

Multilingual self-supervised speech models can benefit from sharing information across languages, but under a matched total pretraining data budget they still fall short of monolingual models. We show that strengthening the model's ability to discriminate languages during pretraining reduces and, on some measures, closes this multilingual gap on continuous phonetic and higher-level linguistic measures, while preserving substantial cross-language sharing. Using a controlled English/French HuBERT setting, we test two interventions which strengthen language discrimination: an auxiliary language...