Ejecutar un modelo en local es una descarga, y la descarga se queda. Cada herramienta que facilita la inferencia local también facilita probar un modelo más, y ninguna le dice a cuánto ascendió el último mes de pruebas. En los Mac que escaneamos, la categoría de modelos de IA es el elemento individual más grande para cualquiera que haya pasado una tarde con Ollama, y es la que más sorprende a la gente, porque nada en las herramientas muestra un total.
Este artículo explica dónde guarda cada herramienta sus archivos, cuánto ocupan, por qué las pruebas los multiplican y cuáles puede borrar sin perder nada que no pueda recuperar.
Cuánto ocupa un modelo
El tamaño depende del número de parámetros y de la cuantización. Como regla general para los formatos que descargan estas herramientas:
| Tamaño del modelo | 4 bits (Ollama, MLX, la mayoría de GGUF) | 8 bits | 16 bits (safetensors de Hugging Face tal como se publican) |
|---|---|---|---|
| 1 a 3B | 1 a 2 GB | 2 a 3.5 GB | 2.5 a 7 GB |
| 7 a 9B | 4 a 5.5 GB | 8 a 9.5 GB | 14 a 18 GB |
| 12 a 14B | 7 a 9 GB | 13 a 15 GB | 25 a 30 GB |
| 27 a 35B | 16 a 20 GB | 32 a 36 GB | 55 a 70 GB |
| 70B | 38 a 43 GB | 70 a 75 GB | 130 a 145 GB |
Los tamaños corresponden solo a los pesos, redondeados, a septiembre de 2026. Un modelo de Hugging Face que nunca se cuantizó está en la columna de 16 bits, y por eso un modelo de 8B sin cuantizar ocupa más que tres de 4 bits.
Otros archivos que van de acompañamiento: Whisper large ocupa unos 3 GB, los modelos de imagen como Stable Diffusion y Flux van de 4 a 25 GB por checkpoint, los modelos de embeddings ocupan de 0.3 a 2 GB cada uno, y los modelos de visión y lenguaje incluyen un segundo codificador de 1 a 2 GB.
Dónde los guarda cada herramienta
Ollama guarda todo en ~/.ollama/models. Los pesos son blobs direccionados por contenido, y un manifiesto por etiqueta apunta a ellos, de modo que dos etiquetas del mismo archivo subyacente lo comparten. Dos cuantizaciones del mismo modelo no. ollama list muestra el tamaño de cada modelo y ollama rm elimina uno, y no hay ningún comando que muestre cuánto pesa la carpeta completa.
LM Studio guarda los archivos GGUF y MLX descargados en ~/.lmstudio/models (las versiones antiguas usaban ~/.cache/lm-studio/models), organizados por editor y modelo. Cada descarga es un archivo completo. Probar las versiones Q4, Q5 y Q8 de un modelo son tres copias completas.
Hugging Face es la que sorprende a la gente. Las bibliotecas transformers, diffusers, sentence-transformers y huggingface_hub descargan todas en ~/.cache/huggingface/hub, una carpeta por repositorio, con un snapshot por revisión. Descargue un modelo, vuelva a descargarlo después de que el autor publique una corrección, y tendrá dos snapshots. Cargue un modelo en un script una vez y se queda ahí para siempre. huggingface-cli scan-cache imprime todo el contenido con tamaños, y huggingface-cli delete-cache le guía para eliminar revisiones. Los datasets van a ~/.cache/huggingface/datasets y pueden ser más grandes que los modelos.
MLX en Apple silicon usa la misma caché del hub de Hugging Face para los modelos de mlx-community. Si convirtió un modelo usted mismo con mlx_lm.convert, la salida quedó donde la apuntó, a menudo una carpeta de proyecto, y los pesos originales de 16 bits siguen en la caché del hub. Una conversión ocupa de nuevo el tamaño completo del modelo.
Todo lo demás. Los entornos de Python incorporan PyTorch a razón de 2 a 4 GB por venv, y un Mac con unos cuantos proyectos de ML tiene unos cuantos de ellos. El model runner de Docker y la imagen Docker de Ollama guardan sus propias copias dentro de la imagen de disco de Docker. Los checkpoints de Jupyter y las carpetas .ipynb_checkpoints contienen copias de notebooks, pequeñas de una en una y numerosas.
Por qué las pruebas lo inflan
Una tarde de evaluación se ve así. Descarga Llama 3.1 8B en Ollama para compararlo con Qwen 2.5 7B, 9 GB. Uno de ellos es lento, así que prueba la versión Q8 en LM Studio, 8 GB más. Un artículo menciona un modelo de razonamiento de 14B, 9 GB. Quiere generar embeddings de unos documentos, así que un script descarga un modelo de embeddings y, como copió el ejemplo, la versión de 16 bits del modelo de chat con el que se demostraba, 15 GB. Prueba MLX porque debería ser más rápido en este Mac, y la conversión a 4 bits son otros 4.5 GB junto al original de 16 bits del que se hizo.
Eso son unos 46 GB, cinco herramientas y un modelo que sigue usando. Nada en esa secuencia fue un error. Así funciona la evaluación. La diferencia con una caché de compilación es que la herramienta no lo va a limpiar por usted, y los archivos son tan grandes que un puñado de ellos es la distancia entre un disco cómodo y uno lleno.
En las configuraciones que escaneamos, el Mac de un desarrollador centrado en IA lleva 80 GB o más en esta categoría. Un ingeniero de Python y ML que usa modelos locales de vez en cuando lleva de todos modos de 40 a 50 GB. Vea la tabla completa por configuración.
Qué es seguro borrar
Todo vuelve con una descarga, y por eso Cache Goblin clasifica cada modelo como Restaurable en lugar de Seguro: los lista, muestra el tamaño de cada uno y pregunta antes de moverlos a la Papelera. Nada de un modelo descargado es único de su Mac.
Las excepciones son los archivos que hizo usted. Un fine-tune que entrenó, adaptadores LoRA, un modelo que convirtió con ajustes que tendría que averiguar de nuevo, un GGUF que cuantizó usted mismo con una imatrix. Viven junto a las descargas y se ven iguales, y Cache Goblin trata cualquier peso dentro de una carpeta de proyecto que tocó hace poco como suyo y lo muestra sin ofrecer eliminarlo.
Un orden práctico:
ollama listy elimine los modelos que probó una vez. Conserve el que realmente usa.huggingface-cli scan-cachey borre las revisiones antiguas y todo lo que no recuerde haber descargado. Suele ser la cifra más grande.- Busque en la carpeta de modelos de LM Studio cuantizaciones duplicadas de un mismo modelo y conserve una.
- Revise la caché del hub en busca de un original de 16 bits de un modelo que solo ejecuta como conversión MLX de 4 bits.
- Borre los entornos de Python de proyectos que terminaron. PyTorch son unos cuantos gigabytes por copia.
O ejecute un escaneo. Cache Goblin lista los modelos de Ollama, LM Studio, Hugging Face y MLX por nombre y tamaño en un solo lugar, con el total que las herramientas nunca le muestran, y el botón Restaurable elimina los que elija.
Descargue Cache Goblin gratis para Mac y vea lo que dejó atrás su tarde de pruebas.