vs

    LFM2.5 1.2B vs Llama 3.2 1B

    Dos modelos de clase 1B que se ajustan en una T4 gratuita. Seguimiento de instrucciones, huella de memoria en móviles reales, longitud de contexto, licencias y cuál elegir.

    Overview

    LFM2.5 1.2B y Llama 3.2 1B son las dos bases de clase 1B del catálogo de Ertas en agosto de 2026. Ambas se entrenan en el nivel de GPU T4, ambas caben en el plan gratuito y ambas se exportan a GGUF por debajo de un gigabyte. Sobre el papel parecen intercambiables. En la práctica están construidas para trabajos distintos, y el benchmark que las separa es justamente el que más importa en proyectos en dispositivo.

    Llama 3.2 1B es un transformador denso con una ventana de contexto de 128.000 tokens y el ecosistema más profundo de cualquier modelo abierto pequeño. Si existe una receta de ajuste fino, un preajuste de cuantización o una guía de integración móvil para un modelo de 1B, casi con seguridad existe para este.

    LFM2.5 1.2B es híbrido. Intercala bloques convolucionales de corto alcance con doble compuerta y bloques de atención agrupada por consultas, 16 capas repartidas en 10 convolucionales y 6 de atención. La convolución cuesta tiempo lineal respecto a la longitud de la secuencia, mientras que la atención cuesta tiempo cuadrático, y eso es lo que permite a un modelo tan pequeño seguir siendo barato con indicaciones largas. Su ventana de contexto es de 32.768 tokens, una cuarta parte de la de Llama, y su vocabulario es de 65.536 tokens, lo que explica en buena medida por qué sus exportaciones son tan compactas.

    Feature Comparison

    FeatureLFM2.5 1.2BLlama 3.2 1B
    Parámetros1.170 millones1.000 millones
    ArquitecturaHíbrida: convolución + atención agrupada por consultasTransformador denso
    Ventana de contexto32.768 tokens128.000 tokens
    Tamaño del vocabulario65.536128.256
    IFEval (seguir instrucciones)86,2352,37
    Tamaño de exportación Q4_K_M731 MB810 MB
    Huella medida en móvil719 MB (Galaxy S25 Ultra)Meta no la publica
    LicenciaLFM Open License v1.0Llama Community License
    Nivel de GPU para ajustar en ErtasT4T4
    Entrenable en el plan gratuito de Ertas
    Tokens nativos de llamada a herramientasSí, llamadas estilo Python por defectoMediante formato del prompt
    Corte de conocimientoMediados de 2024Diciembre de 2023
    Madurez del ecosistemaJoven, publicado en 2026El más profundo de cualquier modelo 1B

    Strengths

    LFM2.5 1.2B

    • El seguimiento de instrucciones es la diferencia principal. LFM2.5 1.2B obtiene 86,23 en IFEval frente a 52,37 de Llama 3.2 1B, según las mediciones de Liquid AI a fecha de agosto de 2026. Para un modelo cuyo trabajo es emitir un objeto JSON analizable o una llamada a herramienta bien formada cada vez, ese eje pesa más que la memoria de datos generales.
    • Las llamadas a herramientas son de primera clase, no un truco de ingeniería de prompts. LFM2.5 escribe llamadas a funciones en estilo Python entre tokens dedicados, y basta un prompt de sistema para pasar a salida JSON.
    • Exportaciones más pequeñas con más parámetros: 731 MB en Q4_K_M frente a los 810 MB de Llama, pese a llevar un 17 % más de parámetros, porque el vocabulario de 65.536 tokens mantiene compactas las tablas de embeddings, que dominan el tamaño del archivo a esta escala.
    • Huellas publicadas sobre hardware concreto. Liquid midió 719 MB en un Galaxy S25 Ultra. Meta no publica una cifra equivalente para Llama 3.2 1B, así que dimensionarlo exige medirlo uno mismo.
    • Pesos nativos en bf16, de modo que el entrenamiento en Ertas se mantiene en bf16 en lugar de recurrir a fp32 en hardware Turing.

    Llama 3.2 1B

    • Una ventana de contexto de 128.000 tokens frente a 32.768. Cuatro veces más espacio, y el factor decisivo para cualquier tarea que meta un documento largo en el prompt en lugar de recuperarlo por fragmentos.
    • El ecosistema más profundo de cualquier modelo de clase 1B. Los ajustes finos existentes, los preajustes de cuantización, las guías de integración móvil y las recetas validadas por la comunidad apuntan a Llama en primer lugar.
    • Una licencia que la mayoría de equipos legales ya ha revisado. La Llama Community License incluye un límite de 700 millones de usuarios activos mensuales y requisitos de atribución, y resulta familiar, mientras que la LFM Open License v1.0 es un documento propio de Liquid y exige una lectura nueva.
    • Conocimiento general más amplio. Llama 3.2 1B se entrenó para capacidad general, mientras que LFM2.5 cambia explícitamente conocimiento del mundo por fiabilidad al seguir instrucciones.
    • Mejor en programación y matemáticas, dos tareas para las que Liquid no recomienda LFM2.5.

    Which Should You Choose?

    Conviertes documentos en JSON estructurado o gobiernas herramientas desde un modelo pequeñoLFM2.5 1.2B

    Es el caso para el que se construyó LFM2.5. 86,23 frente a 52,37 en IFEval marca la diferencia entre un modelo que produce de forma fiable la forma que pediste y otro que hay que envolver en lógica de reintentos. Los datos salen del documento, así que aquí el menor conocimiento del mundo no cuesta nada.

    Tu prompt lleva un documento largo, una transcripción completa o un historial de chat extensoLlama 3.2 1B

    128.000 frente a 32.768 tokens lo decide. La arquitectura híbrida de LFM2.5 abarata el procesamiento de prompts largos, pero no puede procesar un prompt que exceda su ventana, y trocearlo para que quepa reintroduce el problema de recuperación que querías evitar.

    Vas a distribuir un modelo dentro de un navegador, un videojuego o la descarga de una aplicación de consumoLFM2.5 1.2B

    731 MB frente a 810 MB es una diferencia modesta por sí sola, pero la ventaja real son las mediciones publicadas en dispositivo: puedes dimensionar el despliegue antes de escribir una línea de código. Chatty Valley distribuye un ajuste fino de LFM2.5 1.2B de 697 MB dentro de un mod de Stardew Valley, ejecutándose en la CPU del propio jugador.

    Necesitas conocimiento general, ayuda con código o razonamiento matemático de un modelo de 1BLlama 3.2 1B

    Liquid desaconseja explícitamente LFM2.5 para tareas intensivas en conocimiento o para programación. Si el modelo necesita saber cosas en lugar de hacer cosas, Llama 3.2 1B es la mejor base a este tamaño, y una base mayor lo es todavía más.

    Heredas una canalización de 1B ya existente, o tu equipo ya ha aprobado la licencia de LlamaLlama 3.2 1B

    La madurez del ecosistema y una licencia ya revisada son costes reales que habría que volver a pagar. Salvo que la diferencia en seguimiento de instrucciones sea determinante para tu tarea, la migración rara vez se amortiza.

    Verdict

    Elige LFM2.5 1.2B cuando el trabajo del modelo sea seguir instrucciones con precisión dentro de un contexto fijo y moderado: extracción estructurada, llamadas a herramientas, agentes en dispositivo, IA para personajes y videojuegos. La diferencia en IFEval es lo bastante grande como para cambiar lo que puedes distribuir sin una capa de reintentos, y las mediciones publicadas sobre hardware convierten el dimensionado en una consulta en lugar de un experimento.

    Elige Llama 3.2 1B cuando la longitud de contexto decida la tarea, cuando necesites conocimiento general o código, o cuando un ecosistema consolidado y una licencia ya revisada valgan más que la diferencia en seguimiento de instrucciones. Para muchos equipos la respuesta honesta es que Llama es la opción por defecto más segura y LFM2.5 el mejor especialista.

    Los dos se ajustan en una T4 gratuita en Ertas Studio, así que la forma más barata de resolver esto es entrenar ambos con tus propios datos y comparar. A este tamaño eso es una tarde, no un proyecto.

    How Ertas Fits In

    Los dos modelos se ajustan en el nivel T4 de Ertas Studio y ambos caben en el límite de parámetros del plan gratuito, así que puedes entrenar cualquiera de los dos sin pagar nada. Para bases por debajo de 2.000 millones de parámetros, la receta que funciona usa una tasa de aprendizaje más alta y más épocas de las que toleraría un modelo de 7B: entre 3e-4 y 5e-4, tamaño de lote 4, acumulación de gradiente 2 y de 8 a 16 épocas. Los modelos pequeños necesitan más pasadas antes de que un comportamiento se fije.

    Las exportaciones salen en GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors si prefieres mantener el adaptador aparte y fusionarlo tú mismo. Dos desarrollos de Ertas funcionan sobre LFM2.5 en producción y conviene leerlos antes de elegir tamaño: Chatty Valley es un ajuste fino del 1.2B cuantizado a 697 MB dentro de un mod de Stardew Valley, y Corporate Goblin es un LoRA del 230M exportado a ONNX q4 que se ejecuta por completo en el navegador.

    Una nota sobre licencias que viaja con tu ajuste fino en ambos casos. La LFM Open License v1.0 es un documento propio de Liquid AI y no Apache 2.0, y la Llama Community License tiene sus propias condiciones. Un producto comercial construido sobre cualquiera de las dos bases exige leer la licencia en lugar de darla por supuesta.

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.