# Training and Finetuning Sparse Embedding Models with Sentence Transformers

DevFeed: [Training and Finetuning Sparse Embedding Models with Sentence Transformers](<https://devfeed.tech/articles/training-and-finetuning-sparse-embedding-models-with-sentence-transformers-7530.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/train-sparse-encoder>)

Author: Tom Aarsen; Arthur BRESNU

Published: 2025-07-01T00:00:00Z

Content type: tutorial

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [sentence-transformers](<https://devfeed.tech/topics/sentence-transformers.md>), [Embeddings](<https://devfeed.tech/topics/embeddings.md>), [hugging face](<https://devfeed.tech/topics/hugging-face.md>), [Benchmark](<https://devfeed.tech/topics/benchmark.md>)

Tags: [benchmark](<https://devfeed.tech/tags/benchmark.md>), [bm25](<https://devfeed.tech/tags/bm25.md>), [classification](<https://devfeed.tech/tags/classification.md>), [community](<https://devfeed.tech/tags/community.md>), [datasets](<https://devfeed.tech/tags/datasets.md>), [embedding](<https://devfeed.tech/tags/embedding.md>), [examples](<https://devfeed.tech/tags/examples.md>), [guide](<https://devfeed.tech/tags/guide.md>), [hugging-face](<https://devfeed.tech/tags/hugging-face.md>), [models](<https://devfeed.tech/tags/models.md>), [nlp](<https://devfeed.tech/tags/nlp.md>), [open-source](<https://devfeed.tech/tags/open-source.md>), [search](<https://devfeed.tech/tags/search.md>), [sentence-transformers](<https://devfeed.tech/tags/sentence-transformers.md>), [training](<https://devfeed.tech/tags/training.md>), [transformers](<https://devfeed.tech/tags/transformers.md>), [vector](<https://devfeed.tech/tags/vector.md>)

## AI overview

This tutorial explains how to fine-tune sparse embedding models with Sentence Transformers. It covers the required components, pretrained sparse encoders available through the Hugging Face Hub, the distinction between dense and sparse embeddings, interpretability through vocabulary tokens, and neural query/document expansion compared with BM25.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.