La respuesta rápida (agosto de 2026): Hugging Face es la plataforma central para la IA abierta: aloja más de 2 millones de checkpoints de modelos, más de 500 000 datasets y más de 1 millón de apps de demo interactivas llamadas Spaces. Puedes probar cualquier modelo público en el navegador sin configuración alguna, llamar a modelos de forma programática con un solo token que se enruta a 18 socios de cómputo de inferencia, o descargar y ejecutar modelos localmente con la biblioteca Python transformers. Una cuenta gratuita cubre la mayor parte de la experimentación, incluidos cinco minutos diarios de GPU a través de ZeroGPU; el plan PRO cuesta $9/mes; los planes de organización Team y Enterprise parten de $20 y $50 por usuario al mes, respectivamente, con el cómputo medido por separado en todos los planes.
Última verificación: 31 de agosto de 2026, con la documentación oficial y las páginas de precios.
Qué es Hugging Face
Hugging Face es una plataforma, una comunidad y un ecosistema de bibliotecas. La pieza central es el Hub en huggingface.co: un repositorio basado en Git diseñado para artefactos de IA. Cada modelo, dataset y Space es un repositorio con control de versiones, historial de commits, ramas, pull requests e hilos de discusión. Los repositorios usan Xet, una capa de almacenamiento de archivos grandes que deduplica fragmentos entre subidas y acelera las transferencias.
La plataforma es neutral respecto a las familias de modelos. Encontrarás checkpoints de Meta, Google, Microsoft, Mistral, DeepSeek, EleutherAI y miles de colaboradores independientes. Las licencias varían: muchos modelos populares son Apache 2.0 y se pueden usar comercialmente; otros restringen el uso comercial o requieren que envíes una solicitud de acceso y aceptes los términos antes de descargar.
Tres sistemas interconectados conforman la plataforma:
- El Hub: repositorios con control de versiones para modelos, datasets y Spaces, cada uno con visualizadores en el navegador y widgets de inferencia en vivo
- Inference Providers: un router de API serverless que envía tu solicitud a uno de 18 socios de cómputo (Groq, Together AI, Cerebras, Replicate, fal.ai, entre otros) usando un solo token de Hugging Face
- La biblioteca
transformers: una biblioteca Python con más de 164 000 estrellas en GitHub para cargar cualquier modelo del Hub y ejecutarlo en tu propio hardware
Configura tu cuenta y obtén un token
Crea una cuenta gratuita en huggingface.co. No se necesita tarjeta de crédito. Una vez que hayas iniciado sesión, ve a Settings > Access Tokens para crear un token de API.
Para Inference Providers (la API serverless), genera un token de grano fino con el permiso "Make calls to Inference Providers" activado. Para subir modelos o leer repositorios privados, un token estándar de lectura/escritura es suficiente.
Para autenticarte desde la terminal, instala el CLI e inicia sesión:
macOS / Linux standalone installer (recommended)
curl -LsSf https://hf.co/cli/install.sh | bash
or via pip
pip install huggingface_hub
hf auth login
hf auth login te solicita el token y lo almacena en ~/.cache/huggingface/token. A partir de ese momento, todas las bibliotecas de HF leen la autenticación automáticamente desde esta caché. En entornos de CI/CD y Docker, define la variable de entorno HF_TOKEN directamente en lugar de usar el comando de inicio de sesión.
Encuentra y prueba modelos sin escribir código
El explorador de modelos en huggingface.co/models te permite filtrar por tarea, biblioteca, idioma, dataset y licencia. Filtros de tarea más comunes:
text-generationpara modelos de lenguaje de gran escalaautomatic-speech-recognitionpara transcripción (Whisper y sus variantes)text-to-imagepara modelos de difusiónfeature-extractionpara modelos de embeddings usados en búsqueda y RAG
Cada página de modelo incluye una Model Card con el uso previsto, las limitaciones conocidas, los datos de entrenamiento y los resultados de evaluación. Debajo hay un widget de inferencia en vivo respaldado por Inference Providers: escribe un prompt y obtén una respuesta directamente en la página, sin código.
Para comparar modelos de chat en paralelo, el Inference Playground en huggingface.co/playground te permite ejecutar el mismo prompt en varios modelos a la vez.
Los modelos con acceso restringido (Llama, Gemma y otros) muestran un botón de solicitud de acceso en la parte superior de la página del modelo. Debes enviar una solicitud y aceptar los términos de la licencia antes de descargar los pesos o llamar al modelo vía API. La aprobación suele ser automática y casi instantánea para la mayoría de las variantes de Llama.
Llama a cualquier modelo desde tu código
Inference Providers te ofrece una API única que se enruta a 18 socios de cómputo sin margen adicional sobre las tarifas del proveedor. La URL base https://router.huggingface.co/v1 es compatible con OpenAI para completaciones de chat, por lo que puedes usar el SDK de Python o JavaScript de OpenAI cambiando solo una línea.
Instala el cliente Hugging Face Hub:
pip install huggingface_hub
Llama a un modelo de lenguaje con el cliente nativo:
from huggingface_hub import InferenceClient
import os
client = InferenceClient(token=os.environ["HF_TOKEN"])
completion = client.chat.completions.create(
model="openai/gpt-oss-120b", # append :fastest, :cheapest, or :preferred
messages=[{"role": "user", "content": "Explain backpropagation in two sentences."}],
)
print(completion.choices[0].message.content)
Si ya usas el cliente Python de OpenAI, cambia la URL base:
from openai import OpenAI
import os
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
La selección de proveedor se controla con un sufijo en el ID del modelo. :fastest (por defecto) elige el proveedor con mayor throughput para ese modelo. :cheapest minimiza el costo por token de salida. Puedes fijar un proveedor específico por nombre, por ejemplo "openai/gpt-oss-120b:groq".
El endpoint compatible con OpenAI cubre solo completaciones de chat. Para generación de imágenes, embeddings y reconocimiento de voz, usa los métodos de InferenceClient directamente:
image = client.text_to_image(
prompt="A mountain lake at dawn, photorealistic",
model="black-forest-labs/FLUX.1-dev"
)
image.save("output.png")
Ejecuta modelos localmente con la biblioteca Transformers
Para uso sin conexión, fine-tuning o cuando necesitas control total sobre la pila de inferencia, descarga y ejecuta modelos localmente con transformers.
Instala las bibliotecas principales:
pip install -U transformers datasets evaluate accelerate timm
La función pipeline() es el camino más rápido hacia la inferencia local. Descarga y almacena en caché los pesos del modelo desde el Hub en la primera llamada:
from transformers import pipeline
from accelerate import Accelerator
device = Accelerator().device # auto-selects CUDA, Apple MPS, or CPU
Text generation
gen = pipeline("text-generation", model="meta-llama/Llama-2-7b-hf", device=device)
print(gen("The transistor was invented in", max_length=60))
Automatic speech recognition
asr = pipeline("automatic-speech-recognition", model="openai/whisper-large-v3", device=device)
print(asr("interview.flac"))
Para mayor control, usa AutoModel y AutoTokenizer directamente:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Llama-2-7b-hf",
dtype="auto", # loads in the checkpoint's stored precision
device_map="auto", # allocates layers to the fastest device first
)
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-2-7b-hf")
dtype="auto" es importante: sin él, PyTorch usa float32 por defecto, lo que duplica la VRAM necesaria para un modelo almacenado en bfloat16. device_map="auto" gestiona configuraciones multi-GPU y la descarga de pesos de GPU a CPU de forma automática.
Los pesos del modelo almacenados en caché se guardan en ~/.cache/huggingface/hub por defecto. Define la variable de entorno HF_HOME para mover la caché a un disco diferente.
Para equipos que trabajan sobre transformers, consulta la guía de AI Weekly sobre asistentes de coding de IA para entender cómo encajan estas bibliotecas en flujos de desarrollo más amplios.
Crea y aloja una app de demo con Spaces
Los Spaces son la capa de aplicaciones web alojadas del Hub. Subes una app de Gradio o Streamlit a un repositorio de Space y Hugging Face la sirve vía HTTPS con una URL pública. Las cuentas gratuitas reciben una CPU compartida (2 vCPU / 16 GB RAM) sin costo.
ZeroGPU es la opción de GPU del nivel gratuito. Asigna dinámicamente GPUs NVIDIA RTX Pro 6000 Blackwell solo mientras un usuario ejecuta inferencia, y las libera de inmediato. No pagas nada por tiempo inactivo.
ZeroGPU tiene dos tamaños: large (la mitad de la GPU, 48 GB de VRAM) y xlarge (la GPU completa, 96 GB de VRAM). El tamaño xlarge consume 2x tu cuota diaria.
Para usar ZeroGPU en un Gradio Space:
import spaces
import gradio as gr
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained("black-forest-labs/FLUX.1-dev")
pipe.to("cuda") # placed on CUDA at startup; GPU is obtained per request only
@spaces.GPU
def generate(prompt):
return pipe(prompt).images[0]
gr.Interface(fn=generate, inputs=gr.Text(), outputs=gr.Image()).launch()
El decorador @spaces.GPU solicita una GPU cuando se llama a la función y la libera al retornar. Carga los modelos en CUDA al nivel del módulo (fuera de la función decorada): la carga diferida dentro del decorador es considerablemente más lenta porque se saltean las transferencias de CUDA optimizadas al inicio.
ZeroGPU funciona solo con Gradio Spaces. Los Spaces de Docker y Streamlit requieren un nivel de hardware de pago. Las cuentas gratuitas pueden alojar hasta 2 Spaces de ZeroGPU; las cuentas PRO, hasta 10; las cuentas de organización (Team o Enterprise), hasta 50.
Cuando se agota tu cuota diaria de ZeroGPU, el tiempo adicional de GPU cuesta $1 por cada 10 minutos, descontado de un saldo de crédito prepagado que puedes recargar en la configuración de facturación.
Para endpoints de GPU privados y en ejecución continua (APIs de producción, servidores de modelos dedicados), Inference Endpoints despliega cualquier modelo del Hub en hardware gestionado y reservado, facturado por hora.
Cuánto cuesta realmente
El plan de suscripción y la factura de cómputo son independientes. La suscripción mensual incluye funciones y cuotas de uso; la inferencia real y el tiempo de GPU se miden por encima.
| Plan | Precio | Cuota diaria de ZeroGPU | Spaces de ZeroGPU (alojados) | Ideal para |
|---|---|---|---|---|
| Gratuito | $0 | 5 minutos | 2 | Aprendizaje y experimentación |
| PRO | $9/month | 40 minutos (ampliable) | 10 | Profesionales individuales y usuarios avanzados |
| Team | $20/user/month | 40 minutos (ampliable) | 50 org-wide | Equipos que necesitan SSO, registros de auditoría y controles de acceso |
| Enterprise | $50/user/month | 60 minutos (ampliable) | 50 org-wide | Organizaciones que necesitan cumplimiento normativo, aprovisionamiento SCIM y soporte dedicado |
Los costos de cómputo se facturan por encima de cualquier plan de suscripción. Tarifas clave de la página de precios oficial:
- Exceso de ZeroGPU: $1 por cada 10 minutos tras agotar la cuota diaria
- Hardware de GPU dedicado para Spaces: T4 small a $0.40/hora, A100 (80 GB) a $2.50/hora
- Inference Endpoints (servidores de modelos dedicados): T4 a $0.50/hora, H100 a $4.50/hora, H200 (141 GB) a $5.00/hora, B200 (179 GB) a $9.25/hora
- Almacenamiento en el Hub: $12/TB/month para repositorios públicos, $18/TB/month para repositorios privados en el volumen base; se aplican descuentos por volumen a partir de 50 TB y 200 TB
Para experimentos cortos y tráfico irregular, Inference Providers (serverless) es casi siempre más barato que un endpoint dedicado. Los endpoints dedicados tienen sentido cuando necesitas latencia garantizada, ejecutar un modelo privado o ajustado, o cuando el tráfico es tan constante que la facturación por hora resulta más económica que la tarifa por solicitud.
Preguntas frecuentes
¿Necesito una GPU para usar Hugging Face?
Para pruebas en el navegador y llamadas a la API de Inference Providers, no: el cómputo corre en la infraestructura de los socios. Para inferencia local con transformers, una CPU funciona con modelos pequeños, aunque la generación será lenta. Se recomienda una GPU CUDA para cualquier modelo de varios miles de millones de parámetros. Apple Silicon (serie M) es compatible vía el backend MPS y ejecuta modelos de tamaño medio a una velocidad razonable.
¿Cuál es la diferencia entre Inference Providers e Inference Endpoints?
Inference Providers es serverless y compartido: llamas a un modelo a través del router, las solicitudes se distribuyen entre el cómputo disponible y pagas por solicitud (o usas los créditos del nivel gratuito). Inference Endpoints despliega un contenedor dedicado y siempre activo que ejecuta tu modelo elegido en hardware reservado, facturado por hora. Providers es ideal para experimentación y cargas de trabajo variables; Endpoints se adapta a casos de producción donde necesitas latencia garantizada, throughput constante o un modelo privado o ajustado que no puedes exponer a través del router compartido.
¿Puedo usar modelos de Hugging Face en productos comerciales?
Depende de la licencia de cada modelo, no de tu plan de Hugging Face. Consulta el campo de licencia en la Model Card antes de lanzar cualquier cosa. Los modelos Apache 2.0 son generalmente utilizables comercialmente con atribución. Los modelos bajo la Llama 3 Community License o los Términos de Uso de Gemma tienen restricciones comerciales vinculadas al número de usuarios o a categorías de uso. Los modelos de solo investigación prohíben el uso comercial por completo. El filtro de licencias en huggingface.co/models te permite buscar por tipo de licencia específico.
¿Cómo descargo un modelo para ejecutarlo sin conexión?
Usa el CLI: hf download meta-llama/Llama-2-7b-hf descarga el checkpoint en tu caché local. En Python, llamar a from_pretrained() activa la misma descarga automáticamente. Tras la descarga, define HF_HUB_OFFLINE=1 como variable de entorno para evitar llamadas de red durante la inferencia. Los archivos en caché se guardan en ~/.cache/huggingface/hub, salvo que hayas definido HF_HOME.
¿Qué es una Model Card y por qué importa antes de desplegar?
Una Model Card es el archivo de documentación que acompaña a cada modelo del Hub. Incluye el uso previsto, los usos fuera del alcance, los sesgos conocidos, los detalles del dataset de entrenamiento y los benchmarks de evaluación. Para cualquier equipo con requisitos de IA responsable u obligaciones regulatorias, la Model Card es el artefacto principal para auditar un modelo de terceros antes de ponerlo en producción. Los modelos sin tarjetas completas deben tratarse como subdocumentados, independientemente de sus puntuaciones en benchmarks.
Mantente al día con todo lo que sale en el ecosistema de IA. Suscríbete gratis a AI Weekly, 3 números a la semana, leído por más de 40 000 profesionales.