# Training mRNA Language Models Across 25 Species for $165

DevFeed: [Training mRNA Language Models Across 25 Species for $165](<https://devfeed.tech/articles/training-mrna-language-models-across-25-species-for-165-7029.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/OpenMed/training-mrna-models-25-species>)

Author: Maziyar Panahi

Published: 2026-03-31T08:23:44Z

Content type: article

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [Open Source](<https://devfeed.tech/topics/open-source.md>), [Language models](<https://devfeed.tech/topics/language-models.md>), [Transformer](<https://devfeed.tech/topics/transformer.md>), [Tooling](<https://devfeed.tech/topics/tooling.md>), [Code](<https://devfeed.tech/topics/code.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [code](<https://devfeed.tech/tags/code.md>), [healthcare-life-sciences](<https://devfeed.tech/tags/healthcare-life-sciences.md>), [language-models](<https://devfeed.tech/tags/language-models.md>), [models](<https://devfeed.tech/tags/models.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [tooling](<https://devfeed.tech/tags/tooling.md>), [training](<https://devfeed.tech/tags/training.md>)

## AI overview

OpenMed describes an open-source protein AI pipeline covering structure prediction, amino acid sequence design, and codon optimization for mRNA expression. The article compares transformer architectures for codon-level language modeling, reports CodonRoBERTa-large-v2 as the strongest model in its experiments, and details scaling the system to 25 species with runnable code and results.

## Source excerpt

By OpenMed, Open-Source Agentic AI for Healthcare & Life Sciences TL;DR: We built an end-to-end protein AI pipeline covering structure prediction, sequence design, and codon optimization. After comparing multiple transformer architectures for codon-level language modeling, CodonRoBERTa-large-v2 emerged as the clear winner with a perplexity of 4.10 and a Spearman CAI correlation of 0.40, significantly outperforming ModernBERT.