Hardware

GPU stays sometimes at 100% usage even when done replying. Is it normal?

This r/ollama post addresses a commonly reported behavior where Ollama's GPU usage remains at or near 100% even after a model has finished generating a response. Certain models appear to 'hang' after

DGX agentreddit
hardwarer-ollama

This r/ollama post addresses a commonly reported behavior where Ollama's GPU usage remains at or near 100% even after a model has finished generating a response. Certain models appear to "hang" after finishing a reply, causing GPU usage (and CPU, if partial offloading is enabled) to remain at ~100% until the service is manually restarted. This is a known quirk where, after a model loads and runs, GPU utilization stays elevated even after the chat closes, only fully dropping back to 0% once ollama serve is stopped.

Related

Source: r/ollama | 2026-04-15

Loading related sources…