# Insights to keep AI applications reliable

DevFeed: [Insights to keep AI applications reliable](<https://devfeed.tech/articles/insights-to-keep-ai-applications-reliable-11653.md>)

Original publisher: [Read original article](<https://www.gremlin.com/blog/insights-to-keep-ai-applications-reliable>)

Author: Gavin Cahill

Published: 2025-06-23T00:00:00Z

Content type: article

Language: en

Sources: [Gremlin Blog](<https://devfeed.tech/sources/gremlin-blog.md>)

Topics: [Artificial Intelligence](<https://devfeed.tech/topics/ai.md>), [App](<https://devfeed.tech/topics/app.md>), [observability](<https://devfeed.tech/topics/observability.md>), [Resilience](<https://devfeed.tech/topics/resilience.md>), [Incident response](<https://devfeed.tech/topics/incident-response.md>), [Large Language Model](<https://devfeed.tech/topics/llm.md>), [GPU](<https://devfeed.tech/topics/gpu.md>), [Training AI Models](<https://devfeed.tech/topics/training-ai-models.md>), [Software as a service](<https://devfeed.tech/topics/saas.md>)

Tags: [ai](<https://devfeed.tech/tags/ai.md>), [applications](<https://devfeed.tech/tags/applications.md>), [best-practices](<https://devfeed.tech/tags/best-practices.md>), [engineering](<https://devfeed.tech/tags/engineering.md>), [gpu](<https://devfeed.tech/tags/gpu.md>), [gremlin](<https://devfeed.tech/tags/gremlin.md>), [incident-response](<https://devfeed.tech/tags/incident-response.md>), [infrastructure](<https://devfeed.tech/tags/infrastructure.md>), [insights](<https://devfeed.tech/tags/insights.md>), [llm](<https://devfeed.tech/tags/llm.md>), [metrics](<https://devfeed.tech/tags/metrics.md>), [observability](<https://devfeed.tech/tags/observability.md>), [operations](<https://devfeed.tech/tags/operations.md>), [resilience](<https://devfeed.tech/tags/resilience.md>), [saas](<https://devfeed.tech/tags/saas.md>), [testing](<https://devfeed.tech/tags/testing.md>), [training](<https://devfeed.tech/tags/training.md>)

## AI overview

The article explains how engineering teams can keep AI applications reliable. It recommends applying established practices such as observability, resilience testing, service-level objectives, metrics, and incident response while accounting for AI-specific traffic patterns, infrastructure complexity, dependencies, SaaS boundaries, model training, batch processing, and GPU resource surges.

## Source excerpt

AI has become a massive investment for companies, but how do you keep AI applications reliable? Check out these insights from Gremlin, Nobl9, and Pagerduty to find out!