COMPARISON

APIs de IA gratis tras GitHub Models: capacidad comparada

Comparación basada en fuentes de Gemini, Cloudflare Workers AI y Hugging Face tras la retirada de GitHub Models: capacidad útil, privacidad, ciclos y arquitectura.

Comparación de capacidad gratuita de Gemini, Cloudflare Workers AI y Hugging Face tras la retirada de GitHub Models

Basado en varias fuentes verificadas.

Respuesta rápida

Tras la retirada de GitHub Models el 30 de julio de 2026, las alternativas gratuitas más útiles cubren necesidades distintas. Gemini ofrece modelos multimodales bajo cuotas específicas, Cloudflare Workers AI incluye 10.000 Neurons diarios y Hugging Face concede $0,10 mensuales a cuentas gratuitas. Elige por carga, privacidad, periodo de reinicio, portabilidad y comportamiento al agotarse, no por un titular engañoso sobre “tokens gratis”.

GitHub Models ya no es una opción de API gratuita. GitHub afirma que el playground, el catálogo, la API de inferencia y la función para usar claves propias quedaron retirados por completo el 30 de julio de 2026. Esto modifica la lista práctica para quienes necesitan inferencia sin coste durante un prototipo. Las alternativas más sólidas no son equivalentes: Gemini Developer API, Cloudflare Workers AI y Hugging Face Inference Providers miden el uso gratuito con unidades, ciclos y reglas de datos diferentes.

Respuesta rápida

Tras la retirada de GitHub Models el 30 de julio de 2026, las alternativas gratuitas más útiles cubren necesidades distintas. Gemini ofrece modelos multimodales bajo cuotas específicas, Cloudflare Workers AI incluye 10.000 Neurons diarios y Hugging Face concede $0,10 mensuales a cuentas gratuitas. Elige por carga, privacidad, periodo de reinicio, portabilidad y comportamiento al agotarse, no por un titular engañoso sobre “tokens gratis”.

Qué cambió el 30 de julio de 2026

GitHub Models era un puente cómodo entre un playground y una API autenticada con credenciales de GitHub. Permitía comparar modelos sin abrir varias cuentas de proveedor. Esa posibilidad ha terminado. La documentación actual de GitHub indica que GitHub Models está totalmente retirado desde el 30 de julio de 2026, incluidos playground, catálogo, API de inferencia y BYOK. GitHub remite a Azure AI Foundry para un catálogo amplio o a GitHub Copilot para flujos dentro de GitHub, pero ninguno es una continuación directa de aquella API gratuita.

La retirada demuestra por qué un prototipo no debe convertir “API gratuita” en una suposición permanente de infraestructura. El acceso puede reducirse, cambiar de nombre, exigir facturación o desaparecer. Una aplicación resistente necesita una capa adaptadora, medición explícita de capacidad y una respuesta definida cuando se agota la asignación.

La pregunta útil no es “¿qué proveedor regala más tokens?”. No todos miden tokens. La cuestión correcta es qué asignación completa tu carga real con privacidad, previsibilidad y riesgo de migración aceptables.

Comparación rápida

OpciónAsignación gratuita documentada el 29 de septiembre de 2026PeriodoMejor usoLimitación principal
Gemini Developer APIAlgunos modelos son gratuitos, sujetos a límites por modelo y proyectoCuotas RPM, TPM y RPD; los límites activos se muestran en AI StudioPrototipos multimodales, contexto largo y salida estructuradaLas cuotas varían; hay que revisar el tratamiento de datos del servicio no pagado
Cloudflare Workers AI10.000 Neurons al díaReinicio diario a las 00:00 UTCInferencia serverless o en edge con presupuesto diario duroLos Neurons dependen del modelo y no equivalen a una cifra universal de tokens
Hugging Face Inference ProvidersCrédito mensual de $0,10 para usuarios gratuitos, sujeto a cambiosMensualProbar muchos proveedores y modelos abiertos con un clientePresupuesto pequeño y políticas dependientes del proveedor final
GitHub ModelsRetiradoNingunoNinguna carga nuevaPlayground, catálogo, API y BYOK no están disponibles

La tabla evita inventar una equivalencia. Una solicitud Gemini puede incluir texto, imágenes, audio o vídeo. Cloudflare tarifica modelos en Neurons con conversión propia. Hugging Face descuenta el coste efectivo del proveedor de un saldo en dólares. Convertirlo todo en “tokens” sin fijar modelo, longitud, salida y modalidad produciría una precisión falsa.

Gemini: gran capacidad funcional, cuota variable

Gemini Developer API dispone de Free Tier real para modelos seleccionados. La tabla de precios marca entrada y salida sin coste en modelos compatibles como Gemini 2.5 Flash y Flash-Lite, mientras otras opciones o modalidades son exclusivamente de pago. La palabra decisiva es “seleccionados”: la gratuidad corresponde al modelo y al nivel del proyecto, no al simple hecho de poseer una API key.

Google aplica límites de solicitudes por minuto, tokens por minuto y solicitudes por día. Son límites por proyecto, no por clave, y cualquier dimensión puede bloquear una petición. La documentación remite a AI Studio para ver las cuotas activas porque pueden variar; además, los modelos preview suelen tener condiciones más restrictivas. Crear varias claves dentro del mismo proyecto no multiplica la capacidad.

Gemini resulta fuerte para experimentos donde primero importa la capacidad. Según el modelo, cubre texto, imagen, audio, vídeo, embeddings, salidas estructuradas y herramientas. Es adecuado cuando un prototipo requiere algo más que chat básico o cuando una tarea de contexto largo sería incómoda en un modelo serverless pequeño.

Su capacidad gratuita es menos sencilla de presupuestar. “Sin coste” informa del precio por token, pero no del número de trabajos útiles que la aplicación podrá terminar hoy. Debes revisar la cuota activa, elegir un modelo estable y medir entrada, razonamiento y salida. Usar alias preview también aumenta el riesgo de migración.

El tratamiento de datos es otro criterio. La documentación de Google distingue servicios no pagados y de pago. Muchas tablas marcan que los datos del Free Tier pueden usarse para mejorar productos, mientras el nivel pagado aparece con tratamiento distinto. Las condiciones contemplan excepciones regionales y por cuenta. No deduzcas la regla sólo del precio: revisa las condiciones vigentes para facturación, cuenta y región, y nunca envíes secretos o datos personales porque la petición cueste cero.

Cuándo elegir Gemini

Elígelo cuando importen más la capacidad del modelo y las modalidades que una asignación perfectamente fija, y cuando las condiciones de datos sean compatibles. Es especialmente útil para entender documentos, extraer información multimodal, producir JSON estructurado o evaluar tareas que necesitarían varias APIs especializadas.

Evita que sea el único backend de una función pública si una cuota diaria puede detenerla. Implementa respuestas 429, limita la salida y ofrece un estado claro de “capacidad no disponible” en lugar de cambiar silenciosamente a un modelo peor.

Cloudflare Workers AI: el presupuesto diario más claro

Cloudflare documenta 10.000 Neurons gratuitos al día para Workers AI. La asignación se reinicia a las 00:00 UTC. En el plan gratuito, las operaciones posteriores fallan; en Workers Paid, los primeros 10.000 Neurons diarios siguen incluidos y el exceso se cobra con la tarifa documentada.

Es la asignación operativamente más explícita de esta comparación. Se puede tratar como presupuesto diario y observar el consumo en el panel. El matiz es que un Neuron es unidad de cómputo, no token. Cada modelo tiene su conversión, y generación de imágenes, voz o embeddings consumen de forma distinta. Los trabajos diarios deben calcularse desde la fila de precio del modelo exacto.

Workers AI encaja con aplicaciones que ya usan Workers, Pages, AI Gateway, R2, KV, Durable Objects o Vectorize. La inferencia puede invocarse mediante binding, REST o interfaces compatibles descritas por Cloudflare. Mantener lógica e inferencia cerca del edge puede simplificar autenticación y latencia para utilidades públicas pequeñas.

La página de uso de datos de Cloudflare declara que el contenido del cliente no se usa para entrenar modelos ni mejorar servicios de Cloudflare o terceros sin consentimiento explícito. También avisa de que los modelos son servicios de terceros y tienen sus licencias. El contenido puede almacenarse si la aplicación combina inferencia con R2, KV u otro producto de almacenamiento. Por tanto, la política de inferencia no sustituye la revisión de licencia ni el control de logs y persistencia.

Cuándo elegir Cloudflare

Elígelo cuando quieras techo diario previsible, despliegue serverless e integración con una aplicación edge. Funciona bien para embeddings, clasificación, resúmenes, transcripción o chat acotado con máximos conocidos.

No supongas que 10.000 Neurons equivalen a 10.000 solicitudes. Selecciona el modelo, calcula consumo típico y extremo, y define un presupuesto software inferior al máximo para que procesos internos no agoten la capacidad reservada a usuarios.

Hugging Face Inference Providers: gran flexibilidad, presupuesto mínimo

Hugging Face Inference Providers es una capa de agregación y routing, no un motor homogéneo. Su página de precios concede actualmente $0,10 al mes a usuarios gratuitos, sujeto a cambios. PRO recibe $2 y organizaciones Team o Enterprise, $2 por asiento. La asignación gratuita debe entenderse como crédito de evaluación, no capacidad productiva.

Su fortaleza es la variedad. El cliente puede enrutar entre proveedores compatibles, seleccionar uno o utilizar elección automática. La documentación describe failover automático cuando el proveedor preferido aparece no disponible. También admite claves propias: se conserva la forma del cliente, pero la facturación pasa al proveedor externo.

El coste es transparente en principio porque el tráfico enrutado sigue la tarifa del proveedor. No es necesariamente previsible hasta fijar modelo y proveedor. Diez centavos pueden permitir muchos embeddings baratos o pocas generaciones costosas. El ciclo mensual también es distinto al reinicio diario de Cloudflare: una ráfaga accidental puede consumir todo el presupuesto experimental del mes.

Hugging Face declara que no almacena cuerpos ni respuestas en solicitudes enrutadas y no usa datos para entrenamiento. Mantiene logs técnicos hasta 30 días sin datos de usuario ni tokens, según su página de seguridad. Sin embargo, cada proveedor final conserva su propia política. La capa común facilita la integración; no unifica todos los regímenes de privacidad.

Cuándo elegir Hugging Face

Úsalo para descubrir modelos, probar portabilidad, comparar modelos abiertos o preparar un prototipo que luego empleará una clave propia. Resulta valioso si la pregunta principal es qué combinación funciona, no cómo ejecutar todo un mes gratis.

No bases una carga pública en $0,10. Tras la evaluación, fija proveedor, registra revisión y licencia del modelo, y configura un límite duro antes de activar pago por uso.

Cómo calcular capacidad de forma justa

Convierte la asignación en trabajos útiles terminados, no en unidades de marketing:

  1. Define un trabajo representativo: clasificar un mensaje de 700 tokens y devolver 80, crear el embedding de un documento de 1.000 tokens o transcribir cinco minutos.
  2. Mide al menos 30 muestras reales. Registra mediana y percentil 95 de entrada, salida, latencia, reintentos y unidades.
  3. Aplica el medidor vigente: dimensiones de cuota de Gemini, Neurons del modelo Cloudflare o coste en dólares del routing de Hugging Face.
  4. Reserva entre 20% y 30% para reintentos, picos, fallos de esquema y pruebas operativas.
  5. Divide el resto por el coste del trabajo en percentil 95, no por el mejor caso.
  6. Repite al cambiar modelo, nivel de razonamiento, contexto, tamaño de imagen o proveedor.

Si un trabajo de Workers AI consume 40 Neurons en percentil 95, 10.000 Neurons no prometen 250 peticiones públicas. Con reserva del 25%, el presupuesto seguro sería 7.500 Neurons, unos 187 trabajos. Es sólo un ejemplo metodológico: la conversión documentada del modelo y tus mediciones deben aportar la cifra real.

En Gemini calcula tres márgenes independientes: RPM, TPM y RPD. Un lote de prompts largos puede agotar tokens por minuto antes que solicitudes por minuto. Un health check demasiado frecuente puede malgastar peticiones diarias. La primera dimensión agotada es el límite real.

En Hugging Face mide dólares por trabajo correcto. Incluye llamadas fallidas si son facturables y distingue routing automático de proveedor fijado. Una mediana barata no basta si algunas salidas largas consumen la mayor parte del crédito mensual.

Arquitectura preparada para la próxima retirada

Sitúa la API detrás de una interfaz interna controlada por la aplicación: mensajes, modalidad, salida máxima, timeout, esquema y requisitos de seguridad. IDs, cabeceras y errores específicos pertenecen a adaptadores.

Usa routing explícito. Un fallback puede cambiar precisión, idioma, filtros, jurisdicción y licencia. Si dos proveedores están aprobados para la misma tarea de bajo riesgo, documenta y prueba ambos. De lo contrario, falla de forma segura con mensaje comprensible.

Trata la capacidad como estado observable. Registra trabajos correctos y rechazados, unidades, latencia, modelo/versión, reinicio y motivo de fallback. Avisa antes del agotamiento. No registres prompts sin necesidad, especialmente si pueden contener información confidencial.

Mantén una salida de pago aunque esté desactivada: proyecto Gemini con facturación, Workers Paid, clave propia detrás de Hugging Face o inferencia alojada. No se trata de gastar automáticamente, sino de conocer la ruta antes de que cambie la gratuidad.

Guía según la carga

Prototipo multimodal de documentos o medios

Empieza por Gemini si el modelo Free Tier elegido admite la modalidad y el contenido encaja con las condiciones. Comprueba la cuota activa en AI Studio y fija un modelo estable.

Función pequeña en edge con tráfico diario

Empieza por Workers AI. Su presupuesto diario se reparte mejor entre usuarios y procesos internos. Selecciona un modelo con precio por unidad documentado y fuerza un máximo por petición.

Evaluación de modelos abiertos o portabilidad

Empieza por Hugging Face Inference Providers. Usa el crédito para evaluar, compara proveedores fijados y decide dónde deben residir facturación y tratamiento de datos.

Aplicación construida sobre GitHub Models

Considera el endpoint retirado, no temporalmente caído. Inventaría modelos, modalidades y esquemas, y ejecuta una migración emparejada. Azure AI Foundry puede encajar si se busca catálogo gestionado, pero su facturación e identidad deben analizarse aparte; aquí no se presenta como sustituto gratuito.

Errores frecuentes

El primero es contar claves en lugar de proyectos o cuentas. Varias claves suelen compartir cuota.

El segundo es comparar asignaciones sin fijar modelo. Tokens, Neurons y dólares no son intercambiables.

El tercero es tratar “gratis” como garantía de privacidad. Precio y uso de datos son cuestiones contractuales distintas.

El cuarto es depender de previews o alias `latest` sin plan de retirada.

El quinto es publicar un fallback nunca evaluado. Disponibilidad no equivale a utilidad si rompe esquemas o precisión.

El sexto es diseñar para el promedio. Las colas de salida, reintentos y ráfagas agotan las asignaciones pequeñas.

Limitaciones y fecha de verificación

La comparación se verificó contra documentación oficial pública el 29 de septiembre de 2026. Asignaciones, modelos, cuotas y condiciones pueden cambiar. Las cuotas exactas de Gemini deben verse en AI Studio. El consumo de Cloudflare depende del modelo. El crédito de Hugging Face está expresamente sujeto a cambios y los proveedores finales mantienen políticas propias.

No se compara calidad porque los catálogos no representan el mismo conjunto de modelos y tareas. Se comparan mecanismos de acceso gratuito, previsibilidad, routing y gobierno de datos. No es asesoramiento legal.

Veredicto final

No existe un sucesor único de GitHub Models.

Gemini es la opción general más fuerte para experimentos multimodales y ricos en capacidad si encajan cuota y condiciones. Cloudflare Workers AI ofrece la capacidad recurrente más clara para una función serverless acotada. Hugging Face aporta la mayor flexibilidad de descubrimiento y routing, pero su crédito mensual gratuito es para evaluación, no para producción duradera.

La decisión resistente es arquitectónica: medir trabajos completados, fijar modelo, imponer presupuesto, mostrar el agotamiento con claridad y mantener sustituibles los proveedores.

Fuentes y guías relacionadas de FreeAI Tokens

La evidencia principal procede del aviso de retirada de GitHub, la documentación de precios, facturación y límites de Gemini, las páginas de precios y uso de datos de Cloudflare Workers AI, y la documentación de precios, routing y seguridad de Hugging Face Inference Providers. Las cifras se atribuyen a esas fuentes oficiales y se fechan; no se presentan como promesas permanentes.

Consulta también APIs de IA gratis, planes gratuitos de IA, créditos GPU gratis y el hub editorial de FreeAI Tokens.

Preguntas frecuentes

¿Sigue disponible GitHub Models?

No. GitHub indica que playground, catálogo, API de inferencia y BYOK quedaron totalmente retirados el 30 de julio de 2026. GitHub Copilot es otro producto.

¿Qué API gratuita tiene la asignación recurrente más clara?

Cloudflare Workers AI documenta 10.000 Neurons diarios con reinicio a las 00:00 UTC. Las peticiones reales dependen de la conversión del modelo elegido.

¿Cuánta inferencia gratuita ofrece Hugging Face?

Hugging Face concede actualmente $0,10 mensuales a usuarios gratuitos, sujeto a cambios. Conviene considerarlo crédito de evaluación, no capacidad productiva.

¿Varias claves Gemini multiplican la cuota gratuita?

No. Los límites de Gemini se aplican a nivel de proyecto. Varias claves del mismo proyecto comparten la capacidad aplicable.

Fuentes y evidencia