COMPARISON

ThinkingCap vs Swift vs Qwen 3.8-27B: qué dicen los benchmarks

Comparativa basada en fuentes de Qwen 3.8-27B, ThinkingCap y Swift: eficiencia de razonamiento, programación, licencias, cuantización y criterios de elección.

Comparación de Qwen 3.8-27B, ThinkingCap y Swift con precisión, eficiencia de tokens de razonamiento y criterios de despliegue

Basado en varias fuentes verificadas.

Respuesta rápida

ThinkingCap y Swift reducen de forma importante el razonamiento de Qwen 3.8-27B y se mantienen cerca del modelo base en las evaluaciones publicadas. En una comparativa Aider independiente, ThinkingCap igualó su tasa tras reintento usando un 41% menos de tokens medianos; Swift fue algo más corto y rápido. Decide sólo después de probar tus prompts, hardware, cuantización y licencia.

Qwen 3.8-27B es un modelo local de razonamiento muy capaz, pero su modo `xhigh` puede consumir una gran cantidad de tokens antes de responder. ThinkingCap y Swift son derivados postentrenados para reducir ese coste de razonamiento conservando la mayor parte de la precisión del modelo base. La pregunta útil no es simplemente cuál logra la puntuación más alta, sino qué equilibrio encaja mejor: fidelidad al modelo original, trazas más cortas, licencia o consistencia.

Respuesta rápida

ThinkingCap y Swift reducen de forma importante el razonamiento de Qwen 3.8-27B y se mantienen cerca del modelo base en las evaluaciones publicadas. En una comparativa Aider independiente, ThinkingCap igualó su tasa tras reintento usando un 41% menos de tokens medianos; Swift fue algo más corto y rápido. Decide sólo después de probar tus prompts, hardware, cuantización y licencia.

Qué necesita saber quien busca esta comparativa

La intención de búsqueda actual es práctica. El usuario quiere saber si un fine-tune eficiente puede sustituir sin riesgo a Qwen 3.8-27B, cuánto reduce la latencia, si pierde precisión, cuál funciona mejor para programación y si permite uso comercial.

Ninguna de esas preguntas se responde con un único porcentaje. Los resultados publicados proceden de harnesses, topes de salida, semillas, cuantizaciones y hardware distintos. Una autoevaluación del creador muestra si su modelo se comporta como pretendía bajo condiciones controladas. Una prueba independiente ayuda a comprobar si la tendencia se mantiene en otra carga. Ninguna demuestra por sí sola superioridad universal.

La conclusión sólida es más limitada: ambos derivados recortan materialmente la longitud del razonamiento; ambos permanecen lo bastante cerca del modelo base en varias pruebas como para justificar una evaluación propia; y Qwen sigue siendo la referencia más clara cuando importan más la fidelidad máxima y la sencillez de Apache-2.0 que la eficiencia.

Los tres modelos en una tabla

ModeloQué esAfirmación publicada de eficienciaFortaleza principalPrecaución principal
Qwen 3.8-27BModelo original denso y multimodal de 27BReferencia baseModelo oficial, capacidad amplia, Apache-2.0Puede sobrepensar y producir trazas muy largas
ThinkingCap-Qwen3.8-27BFine-tune de BottleCap AI37,2% menos tokens medios de razonamiento en 12 benchmarksPrecisión macro cercana, metodología detallada, varios formatosLicencia PolyForm Small Business más permiso personal; cola más larga que Swift en una prueba independiente
Swift-Qwen3.8-27BDerivado eficiente de UkisAI41,0% menos razonamiento medio en `xhigh`; 58,3% menos mediana en GPQA-DiamondTrazas muy cortas y eficiencia consistenteLa licencia Swift tiene umbral de ingresos; la pérdida de precisión varía por benchmark

Los tres comparten el linaje Qwen 27B, pero no son equivalentes para gobierno y cumplimiento. Debes registrar el model card, licencia, revisión, cuantización y stack de serving de cualquier despliegue.

Qwen 3.8-27B: la referencia original

El model card oficial describe Qwen 3.8-27B como un modelo causal denso de 27.000 millones de parámetros con encoder de visión. Admite imágenes y vídeo, uso de herramientas, ejecución agéntica y ajuste del esfuerzo de razonamiento. Su contexto nativo es de 262.144 tokens y Qwen documenta su extensión hasta un millón mediante técnicas de escalado.

Qwen publica resultados oficiales potentes: 73,0 en Terminal-Bench 2.1, 61,7 en SWE-bench Pro, 79,5 en IFBench y 89,2 en GPQA Diamond. Sirven para entender por qué el modelo base resulta atractivo, pero no deben mezclarse directamente con cifras de otros harnesses. El agente, el timeout, el límite de salida, las muestras y la implementación del benchmark pueden cambiar el resultado.

La ventaja del modelo base es la claridad. Es el artefacto upstream, usa Apache-2.0 y actúa como control frente al que los dos fine-tunes definen sus mejoras. Si ya cumples tus objetivos de latencia y capacidad, permanecer en Qwen puede ser la opción de menor riesgo.

Su inconveniente es precisamente la razón por la que existen ThinkingCap y Swift. Qwen activa el razonamiento por defecto y permite ajustar `reasoning_effort`. Con esfuerzo alto, las consultas difíciles pueden producir trazas enormes. Eso puede ayudar en tareas complejas, pero también aumenta la latencia, consume el límite de salida, reduce concurrencia y hace que una interfaz local se perciba lenta.

Antes de cambiar de modelo, prueba si basta con reducir `reasoning_effort`. El model card de Swift muestra un ejemplo útil: en GPQA-Diamond, Qwen base en `medium` gastó menos tokens que Swift en `xhigh`, pero obtuvo unos cuatro puntos menos. La decisión real es ésta: un fine-tune puede conservar mejor la precisión de alto esfuerzo que bajar el esfuerzo del modelo base, aunque depende de la tarea.

ThinkingCap: ahorro amplio con precisión macro cercana

BottleCap AI compara ThinkingCap con Qwen BF16 en doce benchmarks, a `reasoning_effort=xhigh` y manteniendo sampling y stack de serving. La precisión macro fue 85,8 frente a 86,6 del base, mientras que la reducción media equiponderada de tokens de razonamiento fue 37,2%.

Los resultados por prueba importan más que el titular. ThinkingCap redujo el razonamiento medio un 43,1% en GPQA-Diamond, 57,3% en MMLU-Pro, 65,5% en MMMLU, 46,4% en IFBench y 38,6% en AA-LCR de contexto largo. La precisión cambió poco en muchas pruebas, pero no siempre fue idéntica. AIME 2026 bajó de 98,13% a 94,27%; AA-LCR subió de 81,75% a 84,00%; LiveCodeBench v6 quedó prácticamente igual.

La interpretación prudente es que ThinkingCap no está demostrado como un modelo general más inteligente. Su objetivo declarado es preservar calidad y estilo de Qwen reduciendo razonamiento innecesario. La evidencia apoya una mejora clara de eficiencia con pequeño coste medio de precisión y variación por dominio.

La metodología está bien documentada. BottleCap detalla hardware, versión de vLLM, decodificación especulativa, topes de salida, número de tareas, semillas, intervalos, truncamientos y bucles. Esa transparencia mejora la auditabilidad, pero sigue siendo una evaluación del creador.

Hay variantes BF16, FP8, GGUF, NVFP4 y NVFP4 W4A4. El model card explica su uso con Transformers, vLLM, SGLang, herramientas compatibles con llama.cpp, LM Studio y flujos GGUF para Ollama. La cuantización puede cambiar calidad y rendimiento; no traslades automáticamente una afirmación BF16 a un build concreto de 4 bits.

Swift: eficiencia agresiva con otro perfil de compromiso

UkisAI describe Swift como un derivado que identifica tokens asociados al sobrepensamiento, los penaliza durante el fine-tuning y recupera precisión mediante postentrenamiento adicional. El model card indica también un componente de transferencia basado en el anterior ThinkingCap-Qwen3.6-27B.

En la comparación BF16 de UkisAI, Swift redujo un 41,0% los tokens medios de razonamiento en GPQA-Diamond y pasó de 88,38% a 88,28%. Informó de reducciones del 46,2% en MMLU-Pro, 42,2% en IFBench, 26,7% en AIME 2026, 26,5% en Terminal-Bench 2.1 y 24,3% en LiveCodeBench v6. Las reducciones de mediana fueron a menudo mayores que las de media.

La precisión volvió a variar. MMLU-Pro pasó de 85,47% a 84,95%; AIME 2026 de 98,67% a 94,00%; Terminal-Bench 2.1 de 66,74% a 65,84%; LiveCodeBench v6 subió de 76,76% a 81,55%. UkisAI advierte que esa aparente mejora en LiveCodeBench está influida por truncamientos y no debe leerse como ganancia simple de capacidad.

El atractivo práctico de Swift es la regularidad del acortamiento. En la evaluación Aider independiente, su mediana de tokens y segundos por caso fue algo menor que la de ThinkingCap, y el autor observó una cola media más corta. No demuestra que siempre sea más rápido, pero justifica probarlo cuando las trazas extremas son el problema operacional.

Swift ofrecía también una API de investigación al revisar las fuentes. Un endpoint externo gratuito debe tratarse como comodidad de evaluación, no como infraestructura productiva: disponibilidad, privacidad, límites y condiciones pueden cambiar. Para un sistema duradero conviene despliegue local o proveedor controlado.

Qué aporta la comparativa Aider independiente

Una prueba comunitaria comparó versiones Q8_0 de los tres modelos usando llama.cpp 0.5.0, dos ejecuciones por modelo y una suite orientada a programación con Aider. Es útil porque mantiene harness y cuantización comunes.

Modelo en `xhigh`Éxito al primer intentoÉxito tras reintentoDiff válidoTokens medianosSegundos por casoTokens por solución
ThinkingCap27,1%77,6%100,0%7.43677712,8K
Qwen base27,1%77,6%99,1%12.5471.48119,3K
Swift30,8%75,7%98,1%7.30175012,1K

La comparación respalda tres puntos.

Primero, ambos derivados redujeron cerca del cuarenta por ciento la mediana de tokens frente al base. Segundo, ThinkingCap igualó exactamente el resultado tras reintento de Qwen en esas ejecuciones, mientras Swift quedó dentro del margen de ruido estimado por el autor. Tercero, el ahorro apareció también en segundos por caso y no sólo como razonamiento visible más corto.

Los límites son igual de importantes. Dos ejecuciones no crean una clasificación universal. La suite se centra en código y generación de diffs. Los resultados por lenguaje variaron entre C++, JavaScript y Python, mientras otros lenguajes fueron estadísticamente similares. La prueba usó Q8_0 y no valida cada GGUF, AWQ, NVFP4 o MLX.

Por eso afirmar “gana Swift” o “gana ThinkingCap” sería excesivo. Los datos independientes dicen que ambos son candidatos creíbles y que sus diferencias son lo bastante pequeñas como para exigir evaluación propia.

Qué modelo elegir

Elige Qwen 3.8-27B si priorizas fidelidad al origen

Usa el base oficial cuando quieras la referencia upstream, la licencia Apache-2.0 más sencilla y la menor incertidumbre de postentrenamiento. También es el control correcto para cualquier evaluación. Si la latencia es aceptable, cambiar puede no compensar un nuevo ciclo de licencia y validación.

Elige ThinkingCap si importan auditabilidad y equilibrio

ThinkingCap resulta atractivo si buscas ahorro sustancial respaldado por metodología multibenchmark detallada y precisión macro cercana. Su resultado independiente de programación igualó además al base tras reintento. Revisa la licencia antes de uso comercial, sobre todo ingresos de la organización y elegibilidad del caso.

Elige Swift si el objetivo principal es acortar trazas largas

Swift merece prueba cuando mediana y cola de latencia son el problema. Su reducción publicada en GPQA es grande y en Aider mostró ligeramente menos tokens medianos y segundos por caso que ThinkingCap. La licencia Swift no es Apache-2.0 e incluye un umbral de ingresos para uso comercial gratuito.

La licencia puede decidir antes que el benchmark

Qwen 3.8-27B aparece con Apache-2.0 en Hugging Face.

ThinkingCap figura bajo PolyForm Small Business 1.0.0 más un permiso personal de BottleCap. Es un modelo de permisos diferente.

Swift mantiene Apache-2.0 para el Qwen subyacente, pero la contribución fine-tuned de UkisAI usa Swift Open License v1.0. Su model card dice que el uso personal, investigador, educativo, evaluador y comercial es gratuito para personas y organizaciones con ingresos brutos anuales, incluidas afiliadas, de hasta un millón de dólares; por encima se requiere licencia empresarial.

Este artículo no es asesoramiento legal. Lee los ficheros de licencia actuales y registra la revisión exacta. Una ventaja técnica no sirve si la licencia no encaja.

Plan de evaluación justa para tu carga

Haz una prueba emparejada en lugar de decidir por impresiones.

  1. Selecciona entre 50 y 200 prompts representativos. Elimina secretos y datos personales.
  2. Usa la misma clase de cuantización, motor, contexto, sampling, esfuerzo y tope de salida.
  3. Ejecuta varias semillas en tareas estocásticas.
  4. Puntúa primero el éxito. Una respuesta errónea más corta no es optimización.
  5. Mide entrada, razonamiento, respuesta, tiempo al primer token, latencia total, tokens por segundo, truncamientos, bucles, herramientas y memoria máxima.
  6. Separa tareas fáciles y difíciles.
  7. Revisa fallos de cola, no sólo medianas.
  8. Repite al cambiar cuantización o runtime.

Para agentes de código incluye edición de repositorios, tests, diffs inválidos, reintentos y éxito después de feedback. Para RAG incluye citas correctas y fidelidad a recuperación. En multimodal prueba tus imágenes y documentos reales.

Hardware y cuantización

Un modelo de 27B puede ejecutarse localmente en varios formatos, pero “arranca” y “funciona bien como agente” son criterios distintos. El model card base documenta contexto largo y salidas potencialmente enormes. La caché KV, visión, transcripciones de herramientas y razonamiento extenso añaden memoria más allá del fichero de pesos.

Razonar menos puede mejorar throughput y latencia percibida aunque la velocidad de decodificación no cambie. También reduce la probabilidad de alcanzar el límite de salida. Sin embargo, carga del modelo, prefill, decodificación especulativa, kernels y cuantizador pueden dominar algunas cargas.

Compara configuraciones completas. Registra motor y versión, cuantización, GPU o Apple Silicon, memoria, longitud de contexto, batch, opciones especulativas y visión.

Limitaciones y alcance

Las tablas de los creadores no son comparables directamente porque usan ajustes diferentes y a veces puntuaciones base distintas. La prueba Aider mejora la comparabilidad, pero sólo cubre un harness orientado a código, dos ejecuciones y una cuantización.

La precisión publicada no garantiza tus prompts. Un fine-tune puede mejorar eficiencia y alterar de forma sutil rechazos, herramientas, multilingüismo, formato o calibración. Las APIs gratuitas de investigación no son servicios garantizados. Model cards y licencias pueden cambiar.

La conclusión segura es condicional: ThinkingCap y Swift permiten intercambiar una cantidad pequeña y dependiente de la tarea de precisión por razonamiento mucho más corto. Qwen sigue siendo la referencia y la opción base con licencia más sencilla.

Veredicto final

No existe ganador universal.

Para el baseline más limpio y Apache-2.0, empieza con Qwen 3.8-27B y prueba menor esfuerzo.

Para un fine-tune bien documentado y precisión macro cercana, prueba ThinkingCap.

Para acortamiento agresivo y ligera ventaja mediana en la comparación independiente de código, prueba Swift.

No decidas por el titular del creador. Ejecuta los tres con el mismo stack y acepta un derivado sólo si preserva la tasa de éxito relevante para tu aplicación.

Fuentes y evidencia

La comparación utiliza los model cards oficiales de Qwen 3.8-27B, ThinkingCap y Swift; la publicación metodológica de BottleCap AI; y una comparación Aider independiente reflejada por Prismix y enlazada a su publicación original en LocalLLaMA. La revisión práctica de Simon Willison aporta contexto sobre el sobrepensamiento. Cada cifra conserva la atribución a su evaluación y no se presenta como si todas pertenecieran a un mismo leaderboard.

Para más recursos relacionados consulta APIs de IA gratis, planes gratuitos de IA, créditos GPU gratis y el hub editorial de FreeAI Tokens.

Preguntas frecuentes

¿ThinkingCap es mejor que Qwen 3.8-27B?

ThinkingCap consumió bastante menos razonamiento con precisión media cercana en su suite, pero no mejoró todos los benchmarks. Debe tratarse como un compromiso de eficiencia y validarse con la carga real.

¿Swift es más rápido que ThinkingCap?

En una comparación Aider Q8_0 independiente, Swift usó ligeramente menos tokens medianos y segundos por caso. La diferencia fue pequeña y no crea un ranking universal para cualquier hardware, runtime o tarea.

¿Qué modelo tiene la licencia comercial más sencilla?

Qwen 3.8-27B figura bajo Apache-2.0. ThinkingCap y Swift añaden condiciones propias, por lo que debes revisar los ficheros actuales y sus límites de ingresos o uso.

¿Se pueden comparar directamente las tablas de los creadores?

No. Usan harnesses, topes, semillas y a veces baselines diferentes. Cada tabla sirve para comparar el derivado con su propio control; después necesitas una prueba emparejada bajo una única configuración.

Fuentes y evidencia