Tamaños de LFM2.5: 230M frente a 350M y 1.2B en dispositivo
Liquid AI publica LFM2.5 en tres tamaños. Benchmarks, tamaños de exportación y lo que aprendimos ajustando dos de ellos hasta convertirlos en productos, incluido el fallo que ninguna métrica detectó.
La familia LFM2.5 de Liquid AI ya está en el catálogo de Ertas en tres tamaños: 230M, 350M y 1.2B. Los tres son de pesos abiertos, los tres tienen una ventana de contexto de 32.768 tokens, los tres funcionan con menos de un gigabyte de memoria y los tres se entrenan en nuestro nivel de GPU de entrada dentro del plan Free.
Todos funcionan. La pregunta interesante es cuál deberías elegir, y resulta que tiene una respuesta más limpia que la mayoría de comparaciones de modelos.
La versión corta: elige el 1.2B si el modelo tiene que mantener una conversación. Elige el 350M o el 230M si cada petición se sostiene sola. La línea que los separa es la coherencia conversacional, y está más marcada de lo que sugieren las puntuaciones de los benchmarks.
| Si tu modelo necesita | Elige | Descarga Q4_K_M |
|---|---|---|
| Mantener una conversación de varios turnos, ejecutar un bucle de agente | LFM2.5 1.2B | 731 MB |
| Llamar herramientas, extraer campos, emitir JSON, una petición cada vez | LFM2.5 350M | 229 MB |
| Hacer todo eso dentro de una pestaña del navegador o una Raspberry Pi | LFM2.5 230M | 153 MB |
| Saber cosas del mundo | Algo más grande | n/a |

La arquitectura es solo en parte un transformer
LFM2.5 intercala bloques de convolución de corto alcance con doble compuerta y bloques de atención de consultas agrupadas. El 1.2B y el 350M usan 16 capas, repartidas en 10 de convolución y 6 de atención. El 230M usa 14 capas, repartidas en 8 y 6.
Ese reparto es todo el diseño. La atención cuesta tiempo cuadrático respecto a la longitud de la secuencia; la convolución cuesta tiempo lineal. Mezclarlas mantiene asequible un prompt largo con recuentos de parámetros donde un transformer puro empieza a pagar el precio de su propia matriz de atención. Es la razón por la que un modelo de 230M puede llevar una ventana de 32.768 tokens, y por la que estos modelos sostienen su rendimiento en una CPU donde un transformer del mismo tamaño se hundiría.
El vocabulario es de 65.536 tokens en toda la familia. Es una cuarta parte del vocabulario de 256K de Gemma 3, y con estos recuentos de parámetros las tablas de embeddings son buena parte del archivo. Un vocabulario compacto explica casi por completo que un modelo de 1.17B exporte más pequeño que un Gemma 3 1B.
Los tres tamaños en paralelo
| LFM2.5 230M | LFM2.5 350M | LFM2.5 1.2B | |
|---|---|---|---|
| Parámetros | 230M | 350M | 1.17B |
| Capas | 14 (8 conv + 6 GQA) | 16 (10 conv + 6 GQA) | 16 (10 conv + 6 GQA) |
| Presupuesto de preentrenamiento | 19T tokens | 28T tokens | 28T tokens |
| Longitud de contexto | 32.768 | 32.768 | 32.768 |
| Idiomas | 10 | 9 | 8 |
| Publicado | 25 jun 2026 | 31 mar 2026 | 5 ene 2026 |
| Nivel de GPU en Ertas | T4 | T4 | T4 |
| Plan Free | Sí | Sí | Sí |
Dos cosas de esa tabla merecen una pausa.
El 350M recibe el mismo presupuesto de 28 billones de tokens que el 1.2B. Los modelos pequeños suelen estar infraentrenados respecto a su capacidad, porque los presupuestos de cómputo siguen a los recuentos de parámetros. Poner una ejecución de entrenamiento de tamaño completo detrás de 350M parámetros es una decisión deliberada y se nota en las puntuaciones.
El 230M se destiló del 350M en lugar de entrenarse desde cero a ese tamaño, y luego se refinó con optimización directa de preferencias y aprendizaje por refuerzo multidominio. También cubre más idiomas que los otros dos, sumando el italiano.
Benchmarks
Todas las cifras siguientes son las publicadas por Liquid AI en el anuncio de LFM2.5, el artículo del 350M y el artículo del 230M. El 1.2B se midió frente a un conjunto de comparación distinto al de sus hermanos pequeños, así que las dos tablas se mantienen separadas.
LFM2.5-1.2B-Instruct frente al campo de 1B a 1.7B:
| Benchmark | LFM2.5 1.2B | Qwen3-1.7B | Granite-4.0-h-1b | Gemma 3 1B | Llama 3.2 1B |
|---|---|---|---|---|---|
| IFEval | 86,23 | 73,68 | 80,08 | 63,25 | 52,37 |
| IFBench | 47,33 | 21,33 | 24,93 | 20,47 | 15,93 |
| MMLU-Pro | 44,35 | 42,91 | 27,64 | 14,04 | 20,80 |
| GPQA | 38,89 | 34,85 | 24,34 | 24,24 | 16,57 |
| AIME25 | 14,00 | 9,33 | 1 | 1 | 0,33 |
LFM2.5-230M y 350M frente al campo por debajo de 1B:
| Benchmark | LFM2.5 230M | LFM2.5 350M | LFM2-350M | Granite 4.0-H-350M | Qwen3.5-0.8B | Gemma 3 1B IT |
|---|---|---|---|---|---|---|
| IFEval | 71,71 | 76,96 | 64,96 | 61,27 | 59,94 | 63,49 |
| IFBench | 38,40 | 40,69 | 18,20 | 17,22 | 22,87 | 20,33 |
| Multi-IF | 37,70 | 44,92 | 32,92 | 28,70 | 41,68 | 44,25 |
| BFCLv3 | 43,26 | 44,11 | 22,95 | 43,07 | 35,08 | 16,61 |
| BFCLv4 | 21,03 | 21,86 | 12,29 | 13,28 | 18,70 | 7,17 |
| CaseReportBench | 22,51 | 32,45 | 11,67 | 12,44 | 13,83 | 2,28 |
| MMLU-Pro | 20,25 | 20,01 | 19,29 | 13,14 | 37,42 | 14,04 |
| GPQA Diamond | 25,41 | 30,64 | 27,58 | 22,32 | 27,41 | 23,89 |
La forma de ambas tablas es la misma. Las puntuaciones de seguimiento de instrucciones y de llamada a funciones son inusualmente altas para el recuento de parámetros. Las de conocimiento del mundo son normales o peores. Qwen3.5-0.8B se lleva MMLU-Pro por un margen amplio y pierde todas las columnas de seguimiento de instrucciones.
Ese es el intercambio que hace toda la familia, y es el correcto para el trabajo en dispositivo. Un modelo que hace de forma fiable lo que le dices, con los hechos suministrados en el prompt, gana a un modelo que sabe más y obedece peor. Combínalos con recuperación y deja que el índice cargue con el conocimiento.


La otra cifra con la que conviene sentarse: el 230M obtiene 43,26 en BFCLv3 frente al 44,11 de su maestro de 350M. La destilación arrastró la llamada a funciones una clase de tamaño entera casi intacta. Gemma 3 1B IT, con aproximadamente cuatro veces los parámetros, obtiene 16,61 en el mismo benchmark.
La comparación que hicimos de verdad
Los benchmarks nos llevaron a una lista corta. Decidir entre el 350M y el 1.2B requirió construir algo.
Chatty Valley es un mod de Stardew Valley que sustituye el diálogo fijo de un aldeano por un modelo ajustado que se ejecuta en la propia CPU del jugador. Entrenamos tanto el 350M como el 1.2B con el mismo conjunto de datos de personaje y pasamos la misma batería de evaluación por ambos.
Yo quería que ganara el 350M. 229 MB es algo mucho más agradable de pedirle a un desconocido que descargue que 731 MB, y un 350M ajustado mantiene la voz y el formato del personaje de maravilla. Produce frases sueltas que se leen exactamente como el personaje.
Y luego pierde el hilo. Pregúntale algo informal y ligeramente confuso y obtienes una ensalada de palabras fluida y perfectamente en personaje: una respuesta a una pregunta que no hiciste, seguida de la misma idea otra vez por si te la habías perdido. El 1.2B mantiene la conversación, así que eso es lo que se lanzó, con 697 MB cuantizado.
Esta es la parte que merece llevarse a tu propio proyecto. Todas las métricas automáticas decían que el 350M estaba bien. Tasa de ausencia de guiones, tasa de fuga ante jailbreak, distribución de longitud de frase, degeneración, fugas numéricas de edad: todo limpio, en ambos tamaños. El fallo solo era visible hablando con él.
Así que si vas a ajustar algo conversacional a esta escala, escribe una prueba guionizada de varios turnos que reproduzca la forma de conversación que te importa, y ejecútala antes de fiarte de un panel de métricas. Los ejes automáticos detectan regresiones. La coherencia les resulta invisible.
Para trabajo de un solo turno, que es para lo que están construidos el 350M y el 230M, nada de esto aplica. Extracción, clasificación, salida estructurada y llamadas a herramientas son peticiones independientes, y ambos tamaños pequeños las manejan bien.
Un modelo de 230M que se ejecuta en una pestaña del navegador
El 230M se gana su sitio por el tamaño de descarga. Con 153 MB cuantizado es lo bastante pequeño para descargarse dentro de una página web.
Corporate Goblin es nuestra demostración de eso: un ajuste LoRA de LFM2.5-230M, fusionado y exportado a ONNX q4, ejecutándose enteramente en el cliente mediante transformers.js sobre WebGPU con respaldo en WASM. Sin servidor, sin clave de API, sin coste por petición, y nada de lo que escribas en él sale de la máquina del visitante. Responde a cada prompt como un gurú del crecimiento excesivamente seguro de sí mismo y se niega a ser útil, que es justamente la idea.
Lo que demuestra en serio es que un modelo de 230M sostiene una personalidad concreta mucho mejor de lo que sugiere el recuento de parámetros, siempre que la tarea sea estrecha y el conjunto de datos sea consistente al respecto. Los modelos pequeños son genuinamente capaces cuando el trabajo es específico.
Lo que cuesta lanzar cada tamaño
El tamaño de descarga es la restricción que decide la mayoría de proyectos en dispositivo, así que aquí están las cifras reales, leídas de las compilaciones GGUF publicadas por Liquid AI en lugar de estimadas.
| Cuantización | 230M | 350M | 1.2B |
|---|---|---|---|
| Q4_0 | 149 MB | 219 MB | 696 MB |
| Q4_K_M | 153 MB | 229 MB | 731 MB |
| Q5_K_M | 172 MB | 260 MB | 843 MB |
| Q6_K | 191 MB | 293 MB | 963 MB |
| Q8_0 | 247 MB | 379 MB | 1,25 GB |
| BF16 | 462 MB | 712 MB | 2,34 GB |
En los dos tamaños menores, el salto de Q4_K_M a Q6_K cuesta 38 MB y 64 MB respectivamente. Es lo bastante barato como para que merezca la pena comprobar si la calidad extra sale efectivamente gratis para tu tarea antes de quedarte con Q4 por defecto.


Huellas de ejecución, todas medidas por Liquid AI en hardware concreto:
| Dispositivo | Modelo | Memoria | Decodificación |
|---|---|---|---|
| iPhone 13 Mini (Cactus) | 350M | 56 MB | 88 tok/s |
| NPU Snapdragon 8 Elite | 350M | 169 MB | 15 tok/s |
| Raspberry Pi 5 | 230M | 293 MB | 42 tok/s |
| Galaxy S25 Ultra | 230M | 375 MB | 213 tok/s |
| AMD Ryzen AI Max 395+ | 350M | 434 MB | 313 tok/s |
| Galaxy S25 Ultra | 1.2B | 719 MB | 70 tok/s |
| AMD Ryzen AI 9 HX 370 | 1.2B | 856 MB | 116 tok/s |
Como referencia, Qwen3-1.7B necesita 1.306 MB en el mismo Galaxy S25 Ultra donde el 1.2B se queda en 719 MB.
Ajustar LFM2.5 en Ertas
Los tres tamaños se entrenan en el nivel T4, que es nuestro nivel de entrada y el que usa el plan Free. Los tres quedan por debajo del límite de 5B parámetros del plan Free, así que una ejecución completa de entrenamiento del mayor de ellos no cuesta nada empezarla. Los pesos son nativos en bf16, así que el entrenamiento corre en bf16 sin penalización por recurrir a fp32.
La receta que funciona para bases por debajo de 2B:
| Ajuste | Valor |
|---|---|
| Tasa de aprendizaje | 3e-4 a 5e-4 |
| Tamaño de lote | 4 |
| Acumulación de gradiente | 2 |
| Épocas | 8 a 16 |
Los modelos pequeños necesitan más pasadas sobre un conjunto de datos pequeño que uno de 7B antes de que un comportamiento se fije, y toleran la tasa de aprendizaje más alta sin colapsar.
Las exportaciones salen como GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors si prefieres mantener el adaptador aparte y fusionarlo tú mismo. Para despliegue en navegador, fusiona el adaptador y conviértelo a ONNX q4, que es la ruta que toma Corporate Goblin.
Algo que conviene planificar: la llamada a herramientas en esta familia usa llamadas de función en Python envueltas en tokens dedicados <|tool_call_start|> y <|tool_call_end|> por defecto. Puedes pedir JSON en el prompt de sistema si tu entorno de ejecución espera esa forma. Ajusta tus datos de entrenamiento a la forma que pienses lanzar.
Un aviso sobre la licencia antes de lanzar
LFM2.5 se publica bajo la LFM Open License v1.0, que es el documento propio de Liquid AI. El uso comercial está permitido con condiciones, y los términos difieren de Apache 2.0 o MIT. La licencia viaja con tu modelo ajustado, así que léela antes de lanzar un producto comercial sobre esta base. La mayor parte del resto del catálogo de Ertas es Apache 2.0, y resulta fácil suponer que esta coincide.
Preguntas frecuentes
¿Cuál es la diferencia entre LFM2.5 230M, 350M y 1.2B?
Comparten arquitectura y una ventana de contexto de 32.768 tokens, y se diferencian en capacidad. El 1.2B mantiene conversación de varios turnos y bucles de agente. El 350M lo iguala de cerca en llamada a funciones y extracción estructurada con un tercio del tamaño de descarga. El 230M est á destilado del 350M y cede muy poco en llamada a herramientas mientras cabe en 153 MB, lo bastante pequeño para un navegador.
¿Qué tamaño de LFM2.5 es mejor para ajustar un chatbot?
El 1.2B. En nuestras propias pruebas, un 350M ajustado mantuvo la voz de un personaje a la perfección y luego perdió el hilo de una conversación informal de varios turnos, mientras que el 1.2B lo mantuvo. Todas las métricas automáticas pasaron en ambos tamaños, así que la diferencia solo salió a la luz mediante una prueba conversacional guionizada.
¿Puede LFM2.5 ejecutarse en un navegador web?
Sí. Exporta a ONNX, cuantiza a q4 y ejecútalo mediante transformers.js sobre WebGPU con respaldo en WASM. El 230M con 153 MB es la elección práctica para una descarga inicial. Corporate Goblin en playground.ertas.ai es un ejemplo funcionando.
¿Es LFM2.5 mejor que Qwen o Gemma en este tamaño?
En seguimiento de instrucciones y llamada a funciones, claramente. LFM2.5-1.2B obtiene 86,23 en IFEval frente al 73,68 de Qwen3-1.7B y el 63,25 de Gemma 3 1B, y LFM2.5-350M obtiene 44,11 en BFCLv3 frente al 16,61 de Gemma 3 1B IT. En conocimiento del mundo pierde: Qwen3.5-0.8B se lleva MMLU-Pro con 37,42 frente al 20,25 del 230M. Elige según cuál de esas necesite tu tarea.
¿Cuánto cuesta ajustar LFM2.5?
Nada para empezar. Los tres tamaños están por debajo del límite de 5B parámetros del plan Free de Ertas y se entrenan en el nivel T4. Consulta precios para ver qué añaden los niveles de pago.
¿En qué es malo LFM2.5?
Liquid AI no recomienda la familia para tareas intensivas en conocimiento ni programación, y añade matemáticas avanzadas y escritura creativa a esa lista para el 230M. La conversación de varios turnos es el otro límite en los dos tamaños menores. Dale a estos modelos los hechos en el prompt y un trabajo concreto que hacer.
Páginas de modelo con especificaciones completas, benchmarks y requisitos de hardware: familia LFM2.5, LFM2.5 230M, LFM2.5 350M, LFM2.5 1.2B.
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
Chatty Valley: un mod de IA local para Stardew Valley (Parte 1)
Cómo ajusté un modelo de IA de 1.2B que corre en el dispositivo para darle a Linus diálogo de verdad dentro de Stardew Valley, funcionando en tu CPU y sin clave de API. Parte 1 del diario de desarrollo de Chatty Valley.
Modelo 3B Ajustado vs GPT-4: Por Que los Modelos Pequenos Ganan en Tareas de Dominio
La investigacion academica muestra que modelos ajustados de 3B-7B parametros superan consistentemente a GPT-4 en tareas especificas de dominio. Aqui esta la evidencia, el patron y como aplicarlo en tu app.
El Pipeline de IA Cloud-to-Edge: Cómo la Preparación de Datos Encaja Entre Entrenamiento y Despliegue
El pipeline completo de IA cloud-to-edge abarca desde datos crudos hasta despliegue en dispositivo. La preparación de datos es el paso entre datos empresariales crudos y entrenamiento en la nube — y es donde la mayoría de los proyectos de edge AI fallan.