¿Qué modelos de IA puedes correr en tu equipo?
Escribe tu equipo o completa los datos que conozcas. La página conserva la tabla completa aunque el JavaScript no se cargue.
Qué puedes correr
En los Mac con chip Apple no hay VRAM aparte: el procesador y la gráfica comparten la misma memoria.El motor local compara pesos, caché KV y memoria disponible. Ningún número del veredicto lo decide una IA.
Escribe tu equipo para ver qué modelos puedes ejecutar.
- Pesos
- Caché KV
- Runtime y buffers
- Total estimado
Cuantización recomendada:
Velocidad estimada:
Catálogo de modelos locales
Memoria aproximada para pesos, caché KV y overhead de ejecución con 4K tokens. Es una referencia inicial, no una garantía de rendimiento.
| Modelo | Familia | Parámetros | Contexto máx. | Memoria aprox. por cuantización |
|---|---|---|---|---|
| SmolLM2 135M Instruct | SmolLM | 130 M | 8K |
|
| SmolLM2 360M Instruct | SmolLM | 360 M | 8K |
|
| Qwen2.5 0.5B Instruct | Qwen | 490 M | 32K |
|
| Qwen3 0.6B | Qwen | 750 M | 40K |
|
| Gemma 3 1B Instruct | Gemma | 1 B | 32K |
|
| Llama 3.2 1B Instruct | Llama | 1.24 B | 128K |
|
| Qwen2.5 1.5B Instruct | Qwen | 1.54 B | 32K |
|
| SmolLM2 1.7B Instruct | SmolLM | 1.71 B | 8K |
|
| DeepSeek-R1 Distill Qwen 1.5B | DeepSeek | 1.78 B | 128K |
|
| Qwen3 1.7B | Qwen | 2.03 B | 40K |
|
| Granite 3.1 2B Instruct | Granite | 2.53 B | 128K |
|
| Gemma 2 2B Instruct | Gemma | 2.61 B | 8K |
|
| Qwen2.5 3B Instruct | Qwen | 3.09 B | 32K |
|
| Llama 3.2 3B Instruct | Llama | 3.21 B | 128K |
|
| Phi-3.5 mini Instruct | Phi | 3.82 B | 128K |
|
| Phi-4 mini Instruct | Phi | 3.84 B | 128K |
|
| Qwen3 4B | Qwen | 4.02 B | 40K |
|
| Gemma 3 4B Instruct | Gemma | 4.3 B | 128K |
|
| DeepSeek Coder 6.7B Instruct | DeepSeek | 6.74 B | 16K |
|
| Mistral 7B Instruct v0.3 | Mistral | 7.25 B | 32K |
|
| DeepSeek-R1 Distill Qwen 7B | DeepSeek | 7.62 B | 128K |
|
| Qwen2.5 7B Instruct | Qwen | 7.62 B | 32K |
|
| Qwen2.5-Coder 7B Instruct | Qwen | 7.62 B | 32K |
|
| DeepSeek-R1 Distill Llama 8B | DeepSeek | 8.03 B | 128K |
|
| Llama 3 8B Instruct | Llama | 8.03 B | 8K |
|
| Llama 3.1 8B Instruct | Llama | 8.03 B | 128K |
|
| Llama 3.1 Nemotron Nano 8B v1 | Nemotron | 8.03 B | 128K |
|
| Granite 3.1 8B Instruct | Granite | 8.17 B | 128K |
|
| Qwen3 8B | Qwen | 8.19 B | 40K |
|
| Gemma 2 9B Instruct | Gemma | 9.24 B | 8K |
|
| Gemma 3 12B Instruct | Gemma | 12.19 B | 128K |
|
| Mistral NeMo 12B Instruct | Mistral | 12.25 B | 128K |
|
| Phi-4 14B | Phi | 14.66 B | 16K |
|
| DeepSeek-R1 Distill Qwen 14B | DeepSeek | 14.77 B | 128K |
|
| Qwen2.5 14B Instruct | Qwen | 14.77 B | 32K |
|
| Qwen2.5-Coder 14B Instruct | Qwen | 14.77 B | 32K |
|
| Qwen3 14B | Qwen | 14.77 B | 40K |
|
| Codestral 22B v0.1 | Mistral | 22.25 B | 32K |
|
| Mistral Small 3 24B Instruct | Mistral | 23.57 B | 32K |
|
| Gemma 2 27B Instruct | Gemma | 27.23 B | 8K |
|
| Gemma 3 27B Instruct | Gemma | 27.43 B | 128K |
|
| Qwen3 30B-A3B (MoE) | Qwen | 30.53 B | 40K |
|
| DeepSeek-R1 Distill Qwen 32B | DeepSeek | 32.76 B | 128K |
|
| Qwen2.5 32B Instruct | Qwen | 32.76 B | 32K |
|
| Qwen2.5-Coder 32B Instruct | Qwen | 32.76 B | 32K |
|
| Qwen3 32B | Qwen | 32.76 B | 40K |
|
| Mixtral 8x7B Instruct v0.1 (MoE) | Mistral | 46.7 B | 32K |
|
| Llama 3.3 70B Instruct | Llama | 70.55 B | 128K |
|
| Qwen2.5 72B Instruct | Qwen | 72.71 B | 32K |
|
La cifra puede variar según el runtime, el sistema operativo y la configuración.
Cómo leer estas cifras
La memoria parte del tamaño publicado de los pesos de cada archivo GGUF. Después se suma la caché KV, que crece con la longitud del contexto, y un margen para el runtime y las activaciones.
La velocidad siempre será una estimación: depende del ancho de banda, del procesador, del backend y de la configuración. El motor interactivo calculará después el veredicto con tus datos.
Preguntas frecuentes
¿La VRAM es lo mismo que la RAM?
No. La VRAM pertenece a la tarjeta gráfica y suele ser el límite para cargar un modelo en la GPU. La RAM del sistema puede ayudar con CPU u offload, pero normalmente reduce la velocidad.
¿Por qué importa el tamaño del contexto?
La caché KV aumenta a medida que el modelo conserva más tokens de la conversación o del documento. Por eso un modelo que cabe con 4K puede necesitar bastante más memoria con 32K.
¿Dónde puedo descargar estos modelos?
Descarga cada modelo desde el repositorio oficial del proyecto o desde el canal oficial de la herramienta que uses. DescargasIA no aloja instaladores, modelos ni mirrors.