Instalar modelos de OpenAI en local para tener tu propio ChatGPT en Windows, macOS y Linux

Cómo instalar y ejecutar GPT-OSS-20B en tu ordenador (guía completa para correr ChatGPT localmente)

GPT-OSS-20B es un modelo de lenguaje de 20 mil millones de parámetros lanzado por OpenAI con licencia abierta Apache 2.0. Esto significa que puedes descargarlo y ejecutarlo en tu ordenador sin depender de servidores externos ni pagar suscripciones a servicios cloud.

En este artículo aprenderás cuatro formas diferentes de instalar GPT-OSS-20B en local, paso a paso y con comandos listos para copiar/pegar. Además, veremos ventajas, desventajas, requisitos, problemas comunes y soluciones.

Aquí puedes encontrar la presentación oficial de los modelos gpt-oss-120b y gpt-oss-20b de OpenAI

 

¿Por qué gpt-oss-20b es una maravilla para ejecutar en local?

  • Open Source bajo licencia Apache 2.0: puedes usarlo, modificarlo y redistribuirlo con libertad. (WIRED)
  • Equilibra alta precisión con bajos requisitos de hardware, optimizado para sistemas con al menos 16 GB de memoria total. (DataCamp)
  • Soporta razonamiento paso a paso (chain-of-thought), capacidades para herramientas externas y ajuste dinámico del nivel de pensamiento. (Platzi)

 

Ventajas de instalar GPT-OSS-20B en local

  1. Privacidad total: tus datos nunca salen de tu ordenador.
  2. Sin coste por uso: una vez descargado, puedes ejecutarlo ilimitadamente sin pagar por tokens.
  3. Disponibilidad offline: puedes trabajar sin conexión a Internet.
  4. Control absoluto: puedes modificar parámetros, cuantizar el modelo o integrarlo con tus sistemas.
  5. Integración flexible: lo conectas a aplicaciones, APIs internas o scripts de automatización.

 

Inconvenientes y retos

  1. Altos requisitos de hardware: para ejecutarlo de forma fluida necesitas mínimo 16 GB de RAM (idealmente GPU con 12-24 GB VRAM).
  2. Descargas pesadas: el modelo puede ocupar decenas de GB.
  3. Consumo energético elevado: especialmente en GPU de alto rendimiento.
  4. Rendimiento limitado en hardware modesto: puede responder lento si no tienes GPU dedicada o CPU potente.
  5. Mayor responsabilidad técnica: debes gestionar la instalación, actualizaciones y problemas.

 

Requisitos mínimos y recomendados

ComponenteMínimoRecomendado
CPU4 núcleos modernos8 núcleos o más
GPU8 GB VRAM (opcional)16-24 GB VRAM
RAM16 GB32 GB o más
Almacenamiento20 GB libresSSD NVMe 1TB
Sistema OperativoWindows 10 / macOS 12 / Ubuntu 20.04Última versión estable

 

Posibles problemas y cómo resolverlos

  • Memoria insuficiente: usa una versión más pequeña o cuantizada (:q4 en Ollama).
  • Error de permisos: en Linux/macOS usa chmod +x para dar permisos de ejecución.
  • Descargas lentas: usa gestor de descargas o CLI con opción de reanudar (--resume).
  • Puertos ocupados: cambia el puerto de la API (--port).
  • Modelo incompatible: verifica que está en formato correcto (.gguf para llama.cpp).

 

Comparativa rápida de métodos

MétodoDificultadInterfazRendimientoIdeal para
OllamaMuy bajaTerminal/APIAltoUsuarios generales
LM StudioMuy bajaEscritorioAltoUso interactivo con GUI
Hugging Face + llama.cppAltaTerminalMuy altoControl total
vLLMMediaAPIMuy altoIntegración en servidores

 

Guía completa para instalar y ejecutar GPT-OSS-20B en tu ordenador local

GPT-OSS-20B es un modelo de OpenAI de 20 mil millones de parámetros con pesos abiertos (Apache 2.0) que puedes ejecutar totalmente en local, sin depender de la nube.

A continuación encontrarás cuatro formas diferentes de instalarlo, con instrucciones paso a paso, comandos listos para copiar/pegar y posibles problemas con sus soluciones.

 

Opción 1: Ollama (la más fácil y recomendada)

Qué es: Ollama es un runtime local para modelos LLM. Permite descargar, ejecutar y conectar modelos de IA mediante una API local compatible con OpenAI.

Pasos de instalación

  1. Ve a https://ollama.com/download y descarga la versión para tu sistema (Windows, macOS o Linux).
    Descarga de Ollama para Windows, macOS y Linux
  2. Instala la aplicación siguiendo el asistente.

Abre una terminal y ejecuta:

ollama --version
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
# Verifica que Ollama está instalado
ollama --version

# Descarga GPT-OSS-20B (Aproximadamente ocupa 13GB) 
ollama pull gpt-oss:20b

# Ejecuta el modelo en modo interactivo
ollama run gpt-oss:20b

# Ejecuta un prompt sin entrar en el chat
echo "Explica qué es GPT-OSS en 3 líneas" | ollama run gpt-oss:20b

Uso desde Python:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
response = client.chat.completions.create(
    model="gpt-oss:20b",
    messages=[{"role":"user","content":"Dame tres ventajas del GPT-OSS-20B"}]
)
print(response.choices[0].message.content)

Cómo arrancar el servicio de forma manual:


ollama serve

Cómo parar el servicio de Ollama

Cuando instalas Ollama, este corre como un servicio en segundo plano para poder responder a las peticiones.

En Windows:

# Detener el servicio de Ollama
Stop-Service Ollama

# Si quieres que no se inicie automáticamente
Set-Service Ollama -StartupType Manual

También puedes detenerlo temporalmente desde el Administrador de tareas → pestaña Servicios → buscar Ollama → clic derecho → Detener.

En macOS:

# Detener el servicio de Ollama
launchctl unload ~/Library/LaunchAgents/com.ollama.plist

Si lo instalaste como app, también puedes cerrarlo desde la barra de menús.

En Linux:

# Parar Ollama
systemctl stop ollama

# Evitar que arranque al iniciar
sudo systemctl disable ollama

Cómo desinstalar Ollama y/o modelos

En Windows:

  • Ve a Panel de control → Programas → Desinstalar un programa → selecciona Ollama → Desinstalar.

Los modelos descargados (incluido gpt-oss:20b) suelen estar en:

C:\Users\TU_USUARIO\.ollama\models

Puedes borrar esa carpeta para liberar espacio.

En macOS (Homebrew):

brew uninstall ollama
rm -rf ~/.ollama

Si lo instalaste desde el .dmg, arrastra la app a la papelera y borra ~/.ollama.

En Linux (Deb/Ubuntu):

sudo apt remove ollama
rm -rf ~/.ollama

En Linux (Fedora/RHEL):

sudo dnf remove ollama
rm -rf ~/.ollama

Borrar solo un modelo (manteniendo Ollama):

ollama rm gpt-oss:20b

Esto eliminará únicamente ese modelo del disco, liberando varios GB.

Problemas comunes y soluciones:

  • Error de memoria insuficiente: GPT-OSS-20B requiere ~16 GB de RAM/VRAM. Si tienes menos, prueba con una versión más pequeña o activa cuantización (:q4 en Ollama).
  • Descarga interrumpida: borra el modelo con ollama rm gpt-oss:20b y vuelve a descargarlo.
  • La API no responde: asegúrate de que Ollama está en ejecución (ollama list muestra modelos activos).

Un truco para comprobar que tu inteligencia artificial se ejecuta localmente es el siguiente:

  • Puedes desconectar internet y ejecutar ollama run gpt-oss:20b.

  • Verás que el chat sigue funcionando igual, lo que confirma que la inferencia es 100 % local.

Diferencia entre run gpt-oss:20b y serve

La diferencia entre ollama run gpt-oss:20b y ollama serve es grande, porque hacen cosas distintas aunque ambas usen el mismo motor de Ollama:

ollama run gpt-oss:20b

  • Qué hace:
    Ejecuta el modelo gpt-oss:20b directamente en la terminal, en modo interactivo (chat).
  • Uso típico:
    Hablar con la IA directamente, como si fuera un ChatGPT local, pero solo mientras tengas esa terminal abierta.
  • Cómo funciona:
    • Inicia el modelo.
    • Espera tu mensaje.
    • Devuelve la respuesta.
    • Si cierras la terminal, la sesión se pierde.
  • Ejemplo:
    ollama run gpt-oss:20b
    

ollama serve

  • Qué hace:
    Levanta el servidor API de Ollama en http://localhost:11434 para que otros programas (por ejemplo, Python, Node.js, Postman, etc.) puedan hacer peticiones al modelo.
  • Uso típico:
    Cuando quieres integrar Ollama con código propio, por ejemplo:

    from openai import OpenAI
    client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
    
  • Cómo funciona:
    • Inicia un servidor HTTP local.
    • No te abre un chat interactivo.
    • Permite que tu código llame a /v1/chat/completions u otros endpoints.
    • Normalmente se ejecuta en segundo plano o como servicio.
  • Ejemplo:
    ollama serve
    

    (aunque en macOS y Windows Ollama ya corre automáticamente como servicio, por eso te salía el error de address already in use).

En resumen:

  • ollama run → Modo manual, para ti, desde la terminal.
  • ollama serve → Modo servidor API, para que tus scripts/programas usen la IA.

 

Opción 2: LM Studio (interfaz de escritorio)

Qué es: Una aplicación visual que te permite buscar modelos, chatear con ellos y exponer un servidor API local.

Pasos de instalación:

  1. Descarga LM Studio desde https://lmstudio.ai y actualiza a la versión 0.3.21 o superior.
  2. Abre la app, ve a la pestaña Models y busca gpt-oss-20b.
  3. Descarga el modelo.
  4. Ve a la pestaña Chat para interactuar con él o activa Server para conectarlo a tus aplicaciones.

Comando de instalación en CLI (si usas su línea de comandos):

lms get openai/gpt-oss-20b

Problemas comunes y soluciones:

  • La descarga se queda congelada: verifica tu conexión y reinicia LM Studio.
  • Error al iniciar el servidor: revisa que el puerto no esté ocupado; puedes cambiarlo en la configuración.
  • Rendimiento lento: en ajustes, reduce el contexto máximo o activa la opción de usar GPU.

 

Opción 3: Hugging Face + llama.cpp (instalación manual)

Qué es: Método para usuarios avanzados que quieren control total, descargando el modelo desde Hugging Face y ejecutándolo con llama.cpp.

Pasos de instalación:

  1. Instala la CLI de Hugging Face:
pip install huggingface_hub
  1. Inicia sesión:
huggingface-cli login
  1. Descarga el modelo:
huggingface-cli download openai/gpt-oss-20b --local-dir ./gpt-oss-20b
  1. Convierte el modelo a .gguf si no está ya disponible (consulta la doc de llama.cpp).
  2. Ejecuta el modelo:
./main -m ./gpt-oss-20b/model.gguf -p "Resume qué es GPT-OSS en 5 puntos"

Problemas comunes y soluciones:

  • Error “permission denied”: da permisos de ejecución a main (chmod +x main).
  • Descarga muy lenta: usa --local-dir-use-symlinks False para evitar enlaces simbólicos.
  • Incompatibilidad de formato: asegúrate de convertir a .gguf con la herramienta correcta para tu versión de llama.cpp.

 

Opción 4: vLLM (servidor API de alto rendimiento)

Qué es: Un servidor de inferencia rápido, ideal si tienes GPU potente y necesitas servir el modelo como API compatible con OpenAI.

Pasos de instalación:

  1. Crea un entorno virtual y activa:
python -m venv vllm-env
source vllm-env/bin/activate
  1. Instala vLLM:
pip install "vllm>=0.5.5"
  1. Lanza el servidor:
vllm serve openai/gpt-oss-20b --port 8000
  1. Llama a la API:
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-20b",
    "messages": [{"role":"user","content":"Dame ideas para automatizar un e-commerce con IA"}]
  }'

Problemas comunes y soluciones:

  • CUDA no encontrada: revisa que tu GPU esté instalada con drivers y toolkit CUDA correctos.
  • Puerto ocupado: cambia --port 8000 por otro libre.
  • Bajo rendimiento: reduce el número de hilos o el tamaño de batch en la configuración.

 

Buenas prácticas al usar GPT-OSS-20B en local

  1. Haz copias de seguridad del modelo para evitar descargarlo de nuevo.
  2. Mantén drivers actualizados (especialmente GPU NVIDIA/CUDA).
  3. Monitorea el consumo de RAM/VRAM para evitar bloqueos.
  4. Cuantiza el modelo si no necesitas máxima precisión.
  5. Usa entornos virtuales en Python para evitar conflictos de dependencias.

 

 Conclusión

Instalar GPT-OSS-20B en tu ordenador local te da privacidad, control y ahorro en costes, pero exige un hardware potente y conocimientos técnicos básicos.

Si buscas la forma más sencilla, Ollama es la opción ideal. Si prefieres interfaz gráfica, usa LM Studio. Para control total, opta por Hugging Face + llama.cpp o vLLM si necesitas servir el modelo como API.

Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.