From d4701ba513d3fcc5bf2ed4e4e5460f5913ee72eb Mon Sep 17 00:00:00 2001 From: n8programs <43304488+N8python@users.noreply.github.com> Date: Mon, 23 Feb 2026 15:13:25 -0500 Subject: [PATCH] clear cache on prompt ingestion in server (#917) Co-authored-by: N8 --- mlx_lm/generate.py | 1 + 1 file changed, 1 insertion(+) diff --git a/mlx_lm/generate.py b/mlx_lm/generate.py index 8e85ab6..b37a13d 100644 --- a/mlx_lm/generate.py +++ b/mlx_lm/generate.py @@ -1081,6 +1081,7 @@ class BatchGenerator: for uid, length in zip(uids, lengths) ] ) + mx.clear_cache() # Further prompt processing so we need to # 1. Merge the KV caches and prepare for right padded prompts