# mmBERT: ModernBERT goes Multilingual

DevFeed: [mmBERT: ModernBERT goes Multilingual](<https://devfeed.tech/articles/mmbert-modernbert-goes-multilingual-7354.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/mmbert>)

Author: Marc Marone; Orion Weller; William Fleshman; Eugene Yang; Dawn Lawrie; Ben Van Durme

Published: 2025-09-09T00:00:00Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Training AI Models](<https://devfeed.tech/topics/training-ai-models.md>), [Machine Learning & Artificial Intelligence](<https://devfeed.tech/topics/machine-learning-artificial-intelligence.md>), [datasets](<https://devfeed.tech/topics/datasets.md>), [Open Source Models & Datasets](<https://devfeed.tech/topics/open-source-models-datasets.md>), [Data Quality](<https://devfeed.tech/topics/data-quality.md>), [Boilerplate](<https://devfeed.tech/topics/boilerplate.md>)

Tags: [artificial-intelligence](<https://devfeed.tech/tags/artificial-intelligence.md>), [blog-post](<https://devfeed.tech/tags/blog-post.md>), [community](<https://devfeed.tech/tags/community.md>), [data-quality](<https://devfeed.tech/tags/data-quality.md>), [datasets](<https://devfeed.tech/tags/datasets.md>), [llm](<https://devfeed.tech/tags/llm.md>), [model](<https://devfeed.tech/tags/model.md>), [models](<https://devfeed.tech/tags/models.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [open-source-collab](<https://devfeed.tech/tags/open-source-collab.md>), [performance](<https://devfeed.tech/tags/performance.md>), [research](<https://devfeed.tech/tags/research.md>), [speed](<https://devfeed.tech/tags/speed.md>), [training](<https://devfeed.tech/tags/training.md>)

## AI overview

This blog post introduces mmBERT, a massively multilingual encoder model trained on more than 3 trillion tokens across over 1,800 languages. It describes performance and speed improvements over earlier multilingual models, the model's ModernBERT-based architecture, and a progressive strategy for adding languages and balancing training data.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.