# Serverless Inference with Hugging Face and NVIDIA NIM

DevFeed: [Serverless Inference with Hugging Face and NVIDIA NIM](<https://devfeed.tech/articles/serverless-inference-with-hugging-face-and-nvidia-nim-7276.md>)

Original publisher: [Read original article](<https://huggingface.co/blog/inference-dgx-cloud>)

Author: Philipp Schmid; Jeff Boudier

Published: 2024-07-29T00:00:00Z

Content type: release

Language: en

Sources: [Hugging Face - Blog](<https://devfeed.tech/sources/hugging-face-blog.md>)

Topics: [NVIDIA NIM](<https://devfeed.tech/topics/nvidia-nim.md>), [hugging face](<https://devfeed.tech/topics/hugging-face.md>), [Inference](<https://devfeed.tech/topics/inference.md>), [model-serving](<https://devfeed.tech/topics/model-serving.md>), [Serverless](<https://devfeed.tech/topics/serverless.md>), [DGX Cloud](<https://devfeed.tech/topics/dgx-cloud.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>), [Generative AI](<https://devfeed.tech/topics/generative-ai.md>), [API](<https://devfeed.tech/topics/api.md>), [llama](<https://devfeed.tech/topics/llama.md>), [Access Control](<https://devfeed.tech/topics/access-control.md>), [Claude](<https://devfeed.tech/topics/claude.md>)

Tags: [access-control](<https://devfeed.tech/tags/access-control.md>), [api](<https://devfeed.tech/tags/api.md>), [cloud](<https://devfeed.tech/tags/cloud.md>), [dgx-cloud](<https://devfeed.tech/tags/dgx-cloud.md>), [generative-ai](<https://devfeed.tech/tags/generative-ai.md>), [hardware](<https://devfeed.tech/tags/hardware.md>), [hugging-face](<https://devfeed.tech/tags/hugging-face.md>), [inference](<https://devfeed.tech/tags/inference.md>), [llama](<https://devfeed.tech/tags/llama.md>), [llm](<https://devfeed.tech/tags/llm.md>), [nvidia](<https://devfeed.tech/tags/nvidia.md>), [nvidia-dgx](<https://devfeed.tech/tags/nvidia-dgx.md>), [nvidia-nim](<https://devfeed.tech/tags/nvidia-nim.md>), [partnerships](<https://devfeed.tech/tags/partnerships.md>), [pricing](<https://devfeed.tech/tags/pricing.md>), [serverless](<https://devfeed.tech/tags/serverless.md>)

## AI overview

Hugging Face announces a serverless NVIDIA NIM API on the Hugging Face Hub for Enterprise Hub organizations. The service provides API access to open generative AI models, including Llama and Mistral, on NVIDIA DGX Cloud infrastructure, with pay-as-you-go pricing and a guide for creating fine-grained organization tokens. The article notes that the service was deprecated and unavailable as of April 10, 2025.

## Source excerpt

We're on a journey to advance and democratize artificial intelligence through open source and open science.