# FACTS Benchmark Suite: Systematically evaluating the factuality of large language models

DevFeed: [FACTS Benchmark Suite: Systematically evaluating the factuality of large language models](<https://devfeed.tech/articles/facts-benchmark-suite-systematically-evaluating-the-factuality-of-large-language-models-6150.md>)

Original publisher: [Read original article](<https://deepmind.google/blog/facts-benchmark-suite-systematically-evaluating-the-factuality-of-large-language-models/>)

Author: FACTS team

Published: 2025-12-09T11:29:03Z

Content type: article

Language: en

Sources: [Google DeepMind News](<https://devfeed.tech/sources/google-deepmind-news.md>)

Topics: [LLM evaluation / benchmarking](<https://devfeed.tech/topics/llm-evaluation-benchmarking.md>), [Benchmark](<https://devfeed.tech/topics/benchmark.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>), [Kaggle](<https://devfeed.tech/topics/kaggle.md>), [multimodal](<https://devfeed.tech/topics/multimodal.md>)

Tags: [benchmark](<https://devfeed.tech/tags/benchmark.md>), [benchmarks](<https://devfeed.tech/tags/benchmarks.md>), [evaluation](<https://devfeed.tech/tags/evaluation.md>), [kaggle](<https://devfeed.tech/tags/kaggle.md>), [language-models](<https://devfeed.tech/tags/language-models.md>), [large-language-models](<https://devfeed.tech/tags/large-language-models.md>), [leaderboard](<https://devfeed.tech/tags/leaderboard.md>), [multimodal](<https://devfeed.tech/tags/multimodal.md>), [responsibility-safety](<https://devfeed.tech/tags/responsibility-safety.md>), [search](<https://devfeed.tech/tags/search.md>), [web](<https://devfeed.tech/tags/web.md>)

## AI overview

Google DeepMind and Kaggle introduce the FACTS Benchmark Suite, which evaluates the factuality of large language models across internal-knowledge, search, multimodal, and grounded-answering tasks. The suite contains 3,513 publicly available examples, with held-out private sets used to calculate an overall FACTS Score and publish results on a leaderboard.

## Source excerpt

Systematically evaluating the factuality of large language models with the FACTS Benchmark Suite.