El Telar
TUTORIAL // PRIVACIDAD

IA local: cómo correr modelos en tu propio ordenador, sin internet

Ollama y LM Studio, los comandos exactos para instalarlo, qué modelo elegir según cuánta RAM tienes, y la diferencia real de calidad frente a pagar un chat en la nube.

ET
Por la Redacción de El Telar
Guías prácticas de IA y agentes, probadas en flujos de trabajo reales antes de publicarlas.
schedule 11 min de lectura
Web de Ollama, la forma más sencilla de ejecutar modelos de IA en tu ordenador
Captura de pantalla: ollama.com.
C ada consulta que escribes en ChatGPT, Claude o Gemini viaja a un servidor de otra empresa. Para la mayoría de usos eso no supone ningún problema — pero si trabajas con documentos sensibles, quieres cero coste por consulta, o simplemente te interesa entender cómo funciona esto por dentro, existe una alternativa real: modelos de código abierto que corren enteramente en tu ordenador, sin conexión a internet necesaria una vez descargados.
Paso 1

1. Instala Ollama (la vía más simple)

Ollama es una herramienta gratuita y de código abierto que convierte "instalar un modelo de IA" en un solo comando de terminal, sin configuración manual. Disponible para macOS, Windows y Linux.

INSTALACIÓN Y PRIMER MODELO
# 1. Descarga Ollama desde ollama.com e instálalo (como cualquier programa normal)

# 2. Abre una terminal y descarga tu primer modelo
ollama pull llama3.2

# 3. Empieza a hablar con él, ya sin conexión a internet
ollama run llama3.2

# Para salir de la conversación
/bye

A partir de ahí, Ollama también expone una API local en tu propio ordenador (normalmente en localhost:11434) que puedes usar desde tus propios scripts o aplicaciones — el mismo patrón de API que usarías con un proveedor en la nube, solo que apuntando a tu máquina en vez de a un servidor externo.

Paso 2

2. Qué modelo elegir según tu RAM

El factor que más determina qué modelo puedes correr no es tu procesador, es la memoria RAM disponible. Un modelo de código abierto se mide en miles de millones de "parámetros" — cuantos más tiene, más capaz es, pero también más memoria necesita para cargarse.

RAM disponible Tamaño de modelo Ejemplo
8 GB3.000-4.000 M parámetrosllama3.2 (3B), phi3
16 GB7.000-8.000 M parámetrosllama3.1 (8B), mistral, gemma2
32 GB o más13.000-30.000 M parámetrosqwen2.5 (14B-32B), mixtral

Referencia orientativa, no exacta — el consumo real también depende del nivel de "cuantización" (compresión) del modelo que descargues.

Un concepto clave

3. Qué es la "cuantización" y por qué decide si tu modelo cabe

Cada parámetro de un modelo es, en el fondo, un número. La cuantización reduce la precisión con la que se guarda cada uno de esos números — de 16 bits a 8, a 4, incluso menos — para que el modelo ocupe menos espacio en memoria y cargue más rápido, a cambio de perder algo de calidad en las respuestas. Ollama descarga por defecto una versión ya cuantizada de cada modelo (normalmente en 4 bits), pensada para funcionar bien en hardware de consumo sin que tengas que configurar nada.

MÁS CUANTIZACIÓN

Ocupa menos RAM, responde más rápido, pero pierde precisión en tareas que exigen matices — puede notarse en textos largos o instrucciones complejas.

MENOS CUANTIZACIÓN

Más fiel al modelo original, pero necesita más RAM y responde más despacio — solo compensa si tu hardware tiene margen de sobra.

Para empezar, la versión por defecto que descarga ollama pull es la elección correcta en la mayoría de casos — solo merece la pena tocar el nivel de cuantización si notas que la calidad se queda corta para tu uso, o si tienes RAM de sobra y quieres exprimir algo más de precisión.

Qué modelo elegir

4. Los modelos abiertos más usados, uno junto a otro

Modelo Quién lo hace Se nota bien en
LlamaMetaUso general, el más probado por la comunidad
MistralMistral AI (Francia)Buen equilibrio velocidad/calidad en tamaños pequeños
GemmaGoogleEficiencia en poca RAM
QwenAlibabaCódigo y razonamiento, buena relación tamaño/capacidad
DeepSeekDeepSeekRazonamiento paso a paso en modelos de mayor tamaño

No hay un "mejor" absoluto — todos mejoran con cada versión nueva, y la diferencia entre dos de tamaño similar suele notarse solo en tareas concretas. Si no sabes por dónde empezar, llama3.2 es la opción más segura por ser la más documentada y probada por la comunidad.

DIAGRAMA // NUBE VS. LOCAL, EL TRUEQUE REAL
IA EN LA NUBE + Más capaz en razonamiento y código complejo − Necesita conexión − Tus datos salen de tu equipo − Coste por uso o suscripción IA LOCAL + Funciona sin internet + Tus datos nunca salen del equipo + Coste cero por consulta − Menos capaz en tareas difíciles − Limitado por tu hardware
Ninguna de las dos gana en todo — la pregunta correcta es para qué tarea necesitas cada una.
«

IA local no es "una versión peor de ChatGPT". Es una herramienta distinta, para cuando lo que más te importa no es la capacidad máxima, sino que el dato no salga nunca de tu equipo.

— Redacción El Telar
Alternativa

5. LM Studio: la vía con interfaz gráfica

Si prefieres no tocar la terminal, LM Studio ofrece exactamente lo mismo que Ollama pero con una interfaz de ventanas: un buscador de modelos con indicadores visuales de qué tamaños encajan con tu hardware, un chat integrado, y un servidor local que puedes activar con un botón en vez de un comando. Es la opción más cómoda para quien viene del mundo de aplicaciones de escritorio normales y quiere evitar la línea de comandos por completo.

Casos de uso reales
Web de LM Studio, aplicación con interfaz para ejecutar modelos en local
Captura de pantalla: lmstudio.ai.

6. Para qué merece la pena de verdad

TIENE SENTIDO
Documentos confidenciales

Contratos, historiales médicos, código propietario — cualquier cosa que no quieras que salga de tu red, sin depender de la política de privacidad de un tercero.

TIENE SENTIDO
Uso muy frecuente y repetitivo

Si haces miles de consultas sencillas al mes (clasificar texto, resumir emails cortos), el coste cero por consulta compensa rápido frente a una API de pago.

NO COMPENSA TODAVÍA
Código complejo o razonamiento largo

Para depurar un fallo difícil o razonar sobre un problema con muchos pasos, un modelo frontera en la nube sigue rindiendo mejor por un margen real — no te frustres si el local se queda corto ahí.

NO COMPENSA TODAVÍA
Necesitas que busque en internet

Un modelo local no navega la web por defecto — si tu tarea depende de información muy reciente, necesitas conectarlo a herramientas externas, lo que añade complejidad y, de nuevo, conexión a internet.

Un paso más

7. Conectarlo a tus propios documentos, sin que salgan de tu equipo

Una vez tienes un modelo local funcionando, el siguiente paso natural es que responda preguntas sobre tus propios documentos — contratos, apuntes, informes — sin que ese contenido salga nunca de tu ordenador. La técnica se llama RAG (Retrieval-Augmented Generation) y consiste, en esencia, en indexar tus documentos en una base de datos local y hacer que el modelo consulte esa base antes de responder, en vez de depender solo de lo que aprendió durante su entrenamiento. Tanto LM Studio como varias herramientas complementarias de Ollama (AnythingLLM es la más sencilla de instalar) ofrecen esto con una interfaz de "arrastra tu carpeta de documentos" sin necesidad de programar nada. Si quieres entender cómo funciona por dentro antes de montarlo, nuestra guía de RAG explicado cubre el mecanismo completo, aplicable igual en la nube que en local.

Por qué importa de verdad

8. La diferencia legal, no solo técnica, de que el dato no salga

Cuando envías un documento a un chat en la nube, ese contenido sale de tu equipo y pasa por los servidores de otra empresa, sujeto a su política de retención de datos — aunque no lo use para entrenar modelos, técnicamente ha "salido". Con un modelo local, ese problema desaparece por diseño: no hay ningún servidor externo al que enviar nada, porque todo el procesamiento ocurre en tu propia máquina. Para profesiones sujetas a secreto profesional (abogacía, medicina, asesoría fiscal) o para empresas con clientes que exigen contractualmente que sus datos no salgan de un perímetro concreto, esa diferencia no es un matiz técnico — puede ser la diferencia entre poder usar IA para un caso concreto o no poder usarla en absoluto.

Si algo falla

9. Los problemas habituales y cómo resolverlos

Va muy lento, una palabra cada varios segundos

El modelo no cabe en la memoria rápida y el sistema está usando el disco. Prueba una versión más pequeña (menos parámetros) o más cuantizada, y cierra el navegador y otras aplicaciones pesadas mientras lo usas.

El ordenador se calienta y el ventilador no para

Es normal durante la generación: el procesador o la gráfica trabajan al máximo. En un portátil, úsalo enchufado y sobre una superficie dura.

Responde en inglés aunque le hable en español

Algunos modelos pequeños se entrenaron sobre todo en inglés. Pide explícitamente "responde siempre en español" o elige un modelo con buen soporte multilingüe.

Se inventa cosas con más facilidad que ChatGPT

Es esperable: un modelo que cabe en un portátil tiene mucha menos capacidad que los grandes modelos en la nube. Úsalo para tareas acotadas sobre texto que tú le das, no como enciclopedia.

No encuentra el modelo después de instalarlo

Comprueba el nombre exacto con el comando de listado de Ollama. Un error de una letra en la etiqueta del modelo es la causa más común.

En la práctica

10. Tres usos concretos donde lo local compensa

La pregunta útil no es si un modelo local es tan bueno como ChatGPT, porque no lo es. Es si para esta tarea basta, y si el hecho de que nada salga de tu equipo cambia algo.

Resumir documentos confidenciales

Actas de reuniones, informes internos o documentación de clientes. Un modelo mediano resume bien texto que tú le das, y no tienes que preguntarte qué condiciones de uso tiene un servicio externo.

Clasificar o etiquetar mucho texto

Cientos de correos, reseñas o tickets. En local no pagas por uso, así que puedes procesar grandes volúmenes sin vigilar la factura de una API.

Trabajar sin conexión

En un tren o en un sitio con mala cobertura, un modelo local sigue funcionando. Para redactar, reformular o traducir borradores es suficiente.

prompt_suggestion PLANTILLA QUE PUEDES COPIAR
Resume el siguiente documento en:
1. Cinco puntos clave (máximo una línea cada uno).
2. Decisiones o acuerdos que aparecen.
3. Tareas pendientes con su responsable, si se menciona.

Usa solo la información del documento. Si algo no está claro, escribe "no se indica".

Documento:
[pega aquí el texto]
Mantenimiento

11. Actualizar modelos y recuperar espacio en disco

Cada modelo ocupa varios gigas, y es fácil acabar con una docena descargados después de probar. Tanto Ollama como LM Studio permiten ver la lista de modelos instalados y borrar los que no uses; conviene revisarla de vez en cuando. Los modelos abiertos también se actualizan: las nuevas versiones suelen mejorar sin necesitar más memoria, así que merece la pena mirar si hay una revisión reciente del que usas.

Un consejo práctico: quédate con dos modelos, uno pequeño y rápido para tareas sencillas y otro más grande para cuando necesites más calidad. Tener diez no te aporta nada y te llena el disco.

Colibri: modelos gigantes en un ordenador normal

Colibri es un programa de código abierto que mueve modelos de IA enormes, de cientos de miles de millones de parámetros, en un ordenador sin tarjeta gráfica. El truco: estos modelos (llamados de «mezcla de expertos») solo usan una parte pequeña de sí mismos para cada palabra, así que Colibri guarda esa parte en la memoria y lee el resto del disco cuando hace falta.

Hoy funciona con modelos como GLM, Kimi, DeepSeek V4 Flash y Qwen 3.6, y también tiene un motor para generar imágenes.

Dónde conseguirlo: JustVugg/colibri · repositorio oficial ↗

En Windows:

Descarga el ZIP desde «Code → Download ZIP» y abre START-HERE.bat

En Mac (con Homebrew):

xcode-select --install
brew install libomp git python
git clone https://github.com/JustVugg/colibri
cd colibri && ./start-here.sh

Es gratis (Apache 2.0). Pide como mínimo 8 GB de RAM (mejor 16) y unos 22 GB libres en el disco para el modelo más pequeño. Ojo con las expectativas: al leer del disco va bastante más lento que Ollama con un modelo que cabe entero en memoria, así que para el día a día sigue siendo mejor la opción de Ollama que explicamos arriba. Colibri tiene sentido cuando quieres probar un modelo grande que no te cabría de ninguna otra forma.

Preguntas frecuentes

Preguntas frecuentes

ET
Redacción El Telar

Probado en hardware de gama media, no en un servidor de laboratorio.

No sustituye a tu chat en la nube para todo — lo complementa para lo que de verdad debería quedarse en tu equipo.

Continúa explorando el archivo

Ver todas las guías arrow_forward