Cómo instalar y ejecutar GPT-OSS-20B en tu ordenador (guía completa para correr ChatGPT localmente)
GPT-OSS-20B es un modelo de lenguaje de 20 mil millones de parámetros lanzado por OpenAI con licencia abierta Apache 2.0. Esto significa que puedes descargarlo y ejecutarlo en tu ordenador sin depender de servidores externos ni pagar suscripciones a servicios cloud.
En este artículo aprenderás cuatro formas diferentes de instalar GPT-OSS-20B en local, paso a paso y con comandos listos para copiar/pegar. Además, veremos ventajas, desventajas, requisitos, problemas comunes y soluciones.
Aquí puedes encontrar la presentación oficial de los modelos gpt-oss-120b y gpt-oss-20b de OpenAI
¿Por qué gpt-oss-20b es una maravilla para ejecutar en local?
- Open Source bajo licencia Apache 2.0: puedes usarlo, modificarlo y redistribuirlo con libertad. (WIRED)
- Equilibra alta precisión con bajos requisitos de hardware, optimizado para sistemas con al menos 16 GB de memoria total. (DataCamp)
- Soporta razonamiento paso a paso (chain-of-thought), capacidades para herramientas externas y ajuste dinámico del nivel de pensamiento. (Platzi)
Ventajas de instalar GPT-OSS-20B en local
- Privacidad total: tus datos nunca salen de tu ordenador.
- Sin coste por uso: una vez descargado, puedes ejecutarlo ilimitadamente sin pagar por tokens.
- Disponibilidad offline: puedes trabajar sin conexión a Internet.
- Control absoluto: puedes modificar parámetros, cuantizar el modelo o integrarlo con tus sistemas.
- Integración flexible: lo conectas a aplicaciones, APIs internas o scripts de automatización.
Inconvenientes y retos
- Altos requisitos de hardware: para ejecutarlo de forma fluida necesitas mínimo 16 GB de RAM (idealmente GPU con 12-24 GB VRAM).
- Descargas pesadas: el modelo puede ocupar decenas de GB.
- Consumo energético elevado: especialmente en GPU de alto rendimiento.
- Rendimiento limitado en hardware modesto: puede responder lento si no tienes GPU dedicada o CPU potente.
- Mayor responsabilidad técnica: debes gestionar la instalación, actualizaciones y problemas.
Requisitos mínimos y recomendados
| Componente | Mínimo | Recomendado |
|---|---|---|
| CPU | 4 núcleos modernos | 8 núcleos o más |
| GPU | 8 GB VRAM (opcional) | 16-24 GB VRAM |
| RAM | 16 GB | 32 GB o más |
| Almacenamiento | 20 GB libres | SSD NVMe 1TB |
| Sistema Operativo | Windows 10 / macOS 12 / Ubuntu 20.04 | Última versión estable |
Posibles problemas y cómo resolverlos
- Memoria insuficiente: usa una versión más pequeña o cuantizada (
:q4en Ollama). - Error de permisos: en Linux/macOS usa
chmod +xpara dar permisos de ejecución. - Descargas lentas: usa gestor de descargas o CLI con opción de reanudar (
--resume). - Puertos ocupados: cambia el puerto de la API (
--port). - Modelo incompatible: verifica que está en formato correcto (
.ggufpara llama.cpp).
Comparativa rápida de métodos
| Método | Dificultad | Interfaz | Rendimiento | Ideal para |
|---|---|---|---|---|
| Ollama | Muy baja | Terminal/API | Alto | Usuarios generales |
| LM Studio | Muy baja | Escritorio | Alto | Uso interactivo con GUI |
| Hugging Face + llama.cpp | Alta | Terminal | Muy alto | Control total |
| vLLM | Media | API | Muy alto | Integración en servidores |
Guía completa para instalar y ejecutar GPT-OSS-20B en tu ordenador local
GPT-OSS-20B es un modelo de OpenAI de 20 mil millones de parámetros con pesos abiertos (Apache 2.0) que puedes ejecutar totalmente en local, sin depender de la nube.
A continuación encontrarás cuatro formas diferentes de instalarlo, con instrucciones paso a paso, comandos listos para copiar/pegar y posibles problemas con sus soluciones.
Opción 1: Ollama (la más fácil y recomendada)
Qué es: Ollama es un runtime local para modelos LLM. Permite descargar, ejecutar y conectar modelos de IA mediante una API local compatible con OpenAI.
- Ve a https://ollama.com/download y descarga la versión para tu sistema (Windows, macOS o Linux).

- Instala la aplicación siguiendo el asistente.
Abre una terminal y ejecuta:
ollama --version
ollama pull gpt-oss:20b
ollama run gpt-oss:20b# Verifica que Ollama está instalado
ollama --version
# Descarga GPT-OSS-20B (Aproximadamente ocupa 13GB)
ollama pull gpt-oss:20b
# Ejecuta el modelo en modo interactivo
ollama run gpt-oss:20b
# Ejecuta un prompt sin entrar en el chat
echo "Explica qué es GPT-OSS en 3 líneas" | ollama run gpt-oss:20b
Uso desde Python:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
response = client.chat.completions.create(
model="gpt-oss:20b",
messages=[{"role":"user","content":"Dame tres ventajas del GPT-OSS-20B"}]
)
print(response.choices[0].message.content)
Cómo arrancar el servicio de forma manual:
ollama serve
Cómo parar el servicio de Ollama
Cuando instalas Ollama, este corre como un servicio en segundo plano para poder responder a las peticiones.
En Windows:
# Detener el servicio de Ollama
Stop-Service Ollama
# Si quieres que no se inicie automáticamente
Set-Service Ollama -StartupType Manual
También puedes detenerlo temporalmente desde el Administrador de tareas → pestaña Servicios → buscar Ollama → clic derecho → Detener.
En macOS:
# Detener el servicio de Ollama
launchctl unload ~/Library/LaunchAgents/com.ollama.plist
Si lo instalaste como app, también puedes cerrarlo desde la barra de menús.
En Linux:
# Parar Ollama
systemctl stop ollama
# Evitar que arranque al iniciar
sudo systemctl disable ollama
Cómo desinstalar Ollama y/o modelos
En Windows:
- Ve a Panel de control → Programas → Desinstalar un programa → selecciona Ollama → Desinstalar.
Los modelos descargados (incluido gpt-oss:20b) suelen estar en:
C:\Users\TU_USUARIO\.ollama\models
Puedes borrar esa carpeta para liberar espacio.
En macOS (Homebrew):
brew uninstall ollama
rm -rf ~/.ollama
Si lo instalaste desde el .dmg, arrastra la app a la papelera y borra ~/.ollama.
En Linux (Deb/Ubuntu):
sudo apt remove ollama
rm -rf ~/.ollama
En Linux (Fedora/RHEL):
sudo dnf remove ollama
rm -rf ~/.ollama
Borrar solo un modelo (manteniendo Ollama):
ollama rm gpt-oss:20b
Esto eliminará únicamente ese modelo del disco, liberando varios GB.
Problemas comunes y soluciones:
- Error de memoria insuficiente: GPT-OSS-20B requiere ~16 GB de RAM/VRAM. Si tienes menos, prueba con una versión más pequeña o activa cuantización (
:q4en Ollama). - Descarga interrumpida: borra el modelo con
ollama rm gpt-oss:20by vuelve a descargarlo. - La API no responde: asegúrate de que Ollama está en ejecución (
ollama listmuestra modelos activos).
Un truco para comprobar que tu inteligencia artificial se ejecuta localmente es el siguiente:
Puedes desconectar internet y ejecutar
ollama run gpt-oss:20b.Verás que el chat sigue funcionando igual, lo que confirma que la inferencia es 100 % local.
Diferencia entre run gpt-oss:20b y serve
La diferencia entre ollama run gpt-oss:20b y ollama serve es grande, porque hacen cosas distintas aunque ambas usen el mismo motor de Ollama:
ollama run gpt-oss:20b
- Qué hace:
Ejecuta el modelogpt-oss:20bdirectamente en la terminal, en modo interactivo (chat). - Uso típico:
Hablar con la IA directamente, como si fuera un ChatGPT local, pero solo mientras tengas esa terminal abierta. - Cómo funciona:
- Inicia el modelo.
- Espera tu mensaje.
- Devuelve la respuesta.
- Si cierras la terminal, la sesión se pierde.
- Ejemplo:
ollama run gpt-oss:20b
ollama serve
- Qué hace:
Levanta el servidor API de Ollama enhttp://localhost:11434para que otros programas (por ejemplo, Python, Node.js, Postman, etc.) puedan hacer peticiones al modelo. - Uso típico:
Cuando quieres integrar Ollama con código propio, por ejemplo:from openai import OpenAI client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama") - Cómo funciona:
- Inicia un servidor HTTP local.
- No te abre un chat interactivo.
- Permite que tu código llame a
/v1/chat/completionsu otros endpoints. - Normalmente se ejecuta en segundo plano o como servicio.
- Ejemplo:
ollama serve(aunque en macOS y Windows Ollama ya corre automáticamente como servicio, por eso te salía el error de address already in use).
En resumen:
ollama run→ Modo manual, para ti, desde la terminal.ollama serve→ Modo servidor API, para que tus scripts/programas usen la IA.
Opción 2: LM Studio (interfaz de escritorio)
Qué es: Una aplicación visual que te permite buscar modelos, chatear con ellos y exponer un servidor API local.
Pasos de instalación:
- Descarga LM Studio desde https://lmstudio.ai y actualiza a la versión 0.3.21 o superior.
- Abre la app, ve a la pestaña Models y busca
gpt-oss-20b. - Descarga el modelo.
- Ve a la pestaña Chat para interactuar con él o activa Server para conectarlo a tus aplicaciones.
Comando de instalación en CLI (si usas su línea de comandos):
lms get openai/gpt-oss-20b
Problemas comunes y soluciones:
- La descarga se queda congelada: verifica tu conexión y reinicia LM Studio.
- Error al iniciar el servidor: revisa que el puerto no esté ocupado; puedes cambiarlo en la configuración.
- Rendimiento lento: en ajustes, reduce el contexto máximo o activa la opción de usar GPU.
Opción 3: Hugging Face + llama.cpp (instalación manual)
Qué es: Método para usuarios avanzados que quieren control total, descargando el modelo desde Hugging Face y ejecutándolo con llama.cpp.
Pasos de instalación:
- Instala la CLI de Hugging Face:
pip install huggingface_hub
- Inicia sesión:
huggingface-cli login
- Descarga el modelo:
huggingface-cli download openai/gpt-oss-20b --local-dir ./gpt-oss-20b
- Convierte el modelo a
.ggufsi no está ya disponible (consulta la doc dellama.cpp). - Ejecuta el modelo:
./main -m ./gpt-oss-20b/model.gguf -p "Resume qué es GPT-OSS en 5 puntos"
Problemas comunes y soluciones:
- Error “permission denied”: da permisos de ejecución a
main(chmod +x main). - Descarga muy lenta: usa
--local-dir-use-symlinks Falsepara evitar enlaces simbólicos. - Incompatibilidad de formato: asegúrate de convertir a
.ggufcon la herramienta correcta para tu versión dellama.cpp.
Opción 4: vLLM (servidor API de alto rendimiento)
Qué es: Un servidor de inferencia rápido, ideal si tienes GPU potente y necesitas servir el modelo como API compatible con OpenAI.
Pasos de instalación:
- Crea un entorno virtual y activa:
python -m venv vllm-env
source vllm-env/bin/activate
- Instala vLLM:
pip install "vllm>=0.5.5"
- Lanza el servidor:
vllm serve openai/gpt-oss-20b --port 8000
- Llama a la API:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-oss-20b",
"messages": [{"role":"user","content":"Dame ideas para automatizar un e-commerce con IA"}]
}'
Problemas comunes y soluciones:
- CUDA no encontrada: revisa que tu GPU esté instalada con drivers y toolkit CUDA correctos.
- Puerto ocupado: cambia
--port 8000por otro libre. - Bajo rendimiento: reduce el número de hilos o el tamaño de batch en la configuración.
Buenas prácticas al usar GPT-OSS-20B en local
- Haz copias de seguridad del modelo para evitar descargarlo de nuevo.
- Mantén drivers actualizados (especialmente GPU NVIDIA/CUDA).
- Monitorea el consumo de RAM/VRAM para evitar bloqueos.
- Cuantiza el modelo si no necesitas máxima precisión.
- Usa entornos virtuales en Python para evitar conflictos de dependencias.
Conclusión
Instalar GPT-OSS-20B en tu ordenador local te da privacidad, control y ahorro en costes, pero exige un hardware potente y conocimientos técnicos básicos.
Si buscas la forma más sencilla, Ollama es la opción ideal. Si prefieres interfaz gráfica, usa LM Studio. Para control total, opta por Hugging Face + llama.cpp o vLLM si necesitas servir el modelo como API.
