Fine-Tune LFM2.5 with Ertas
La familia LFM2.5 de Liquid AI es un conjunto de modelos de lenguaje híbridos para dispositivo con 230M, 350M y 1.2B parámetros, construidos sobre bloques de convolución con doble compuerta más atención de consultas agrupadas en lugar de una pila puramente transformer. Los tres tienen una ventana de contexto de 32.768 tokens, funcionan con menos de 1GB de memoria y son las bases más pequeñas del catálogo de Ertas.

LFM2.5 at a Glance
| Desarrollador | Liquid AI |
|---|---|
| Tamaños en el catálogo de Ertas | 230M, 350M, 1.2B (1.17B real) |
| Arquitectura | Híbrida: bloques de convolución de corto alcance con doble compuerta más bloques de atención de consultas agrupadas |
| Longitud de contexto | 32.768 tokens (los tres tamaños) |
| Tamaño del vocabulario | 65.536 |
| Corte de conocimiento | Mediados de 2024 |
| Licencia | LFM Open License v1.0 (lfm1.0) |
| Nivel de GPU para ajustar en Ertas | T4 para los tres tamaños |
| Entrenable en el plan Free de Ertas | Sí, los tres |
| Formatos de exportación | GGUF y adaptadores LoRA en safetensors |
| Tamaño de exportación Q4_K_M | 153 MB (230M), 229 MB (350M), 731 MB (1.2B) |
| Plantilla de chat | Estilo ChatML, con llamadas a herramientas en Python por defecto |
Overview
LFM2.5 es la familia de modelos de lenguaje híbridos de Liquid AI construida para despliegue en dispositivo. Hay tres tamaños de texto en el catálogo de Ertas: LFM2.5-230M, LFM2.5-350M y LFM2.5-1.2B-Instruct. Los tres son de pesos abiertos, los tres tienen una ventana de contexto de 32.768 tokens y los tres funcionan con menos de un gigabyte de memoria en un teléfono, un portátil o una Raspberry Pi.
La arquitectura es lo que separa a esta familia de los demás modelos pequeños del catálogo. En lugar de apilar bloques transformer hasta abajo, LFM2.5 intercala bloques de convolución de corto alcance con doble compuerta y bloques de atención de consultas agrupadas. El 1.2B y el 350M usan 16 capas, repartidas en 10 de convolución y 6 de atención. El 230M usa 14 capas, repartidas en 8 y 6. Los bloques de convolución cuestan tiempo lineal respecto a la longitud de la secuencia mientras que la atención cuesta tiempo cuadrático, así que el híbrido mantiene asequibles los prompts largos con recuentos de parámetros donde un transformer puro empieza a pagar el precio de su propia matriz de atención.
La familia llegó en tres lanzamientos durante 2026. LFM2.5-1.2B-Instruct salió el 5 de enero junto con las variantes de visión y audio, con el preentrenamiento ampliado de 10T a 28T tokens respecto a la generación LFM2 anterior. LFM2.5-350M siguió el 31 de marzo con el mismo presupuesto de 28T. LFM2.5-230M llegó el 25 de junio, entrenado con 19T tokens y destilado del 350M, luego refinado con optimización directa de preferencias y aprendizaje por refuerzo multidominio.
Liquid publica cada tamaño en safetensors nativo, GGUF, ONNX y MLX, con compilaciones OpenVINO para hardware Intel. La licencia es la LFM Open License v1.0, que es el propio documento de Liquid en lugar de Apache 2.0 o MIT. El uso comercial está permitido con condiciones, así que conviene leerla antes de lanzar a escala.
En Ertas, los tres tamaños se ajustan en una T4 y caben dentro del límite de 5B parámetros del plan Free. Son las bases más pequeñas que ofrecemos, y para cualquier cosa dirigida a un navegador, un teléfono o un dispositivo con memoria limitada, son el lugar correcto para empezar en vez de reducir un modelo más grande y esperar que la calidad sobreviva.
Key Features
El seguimiento de instrucciones es donde esta familia supera con más claridad a su clase de tamaño. LFM2.5-1.2B-Instruct obtiene 86,23 en IFEval frente al 73,68 de Qwen3-1.7B, un modelo un 45 por ciento más grande, y frente al 52,37 de Llama 3.2 1B. En IFBench, que mide el cumplimiento de restricciones más difíciles, la brecha se amplía a 47,33 frente a 21,33 de Qwen3-1.7B. Para un modelo cuyo trabajo es emitir una llamada a herramienta bien formada o un objeto JSON analizable en cada petición, ese eje importa más que recordar datos.
La llamada a herramientas es una capacidad de primera clase en vez de un truco de ingeniería de prompts. LFM2.5 escribe llamadas de función en Python entre tokens dedicados `<|tool_call_start|>` y `<|tool_call_end|>`, y puedes cambiarlo a salida JSON mediante el prompt de sistema. El 350M obtiene 44,11 en BFCLv3 y el 230M obtiene 43,26, ambos a menos de un punto entre sí y cómodamente por delante del predecesor LFM2-350M con 22,95. Que un modelo de 230M se defienda en un benchmark de llamada a funciones es una sorpresa genuina para ese recuento de parámetros.
La huella de memoria es el titular práctico. Liquid midió el 350M en 56MB en un iPhone 13 Mini con el motor Cactus y en 434MB en un AMD Ryzen AI Max 395+ con llama.cpp. El 230M funciona en 375MB en un Galaxy S25 Ultra con 213 tokens por segundo de decodificación, y en 293MB en una Raspberry Pi 5. El 1.2B se mantiene por debajo de 1GB en objetivos de CPU, móvil y NPU.
La cobertura multilingüe es más amplia de lo que sugiere el tamaño, y se ensancha a medida que los modelos se hacen más pequeños. El 1.2B cubre ocho idiomas, el 350M nueve y el 230M diez, incluido el italiano. Los tres comparten un vocabulario de 65.536 tokens, una cuarta parte del vocabulario de 256K de Gemma 3 y buena parte de la razón por la que las exportaciones son tan pequeñas. Las tablas de embeddings dominan el tamaño del archivo con estos recuentos de parámetros, así que un vocabulario compacto se paga directamente en tamaño de descarga.
Fine-Tuning with Ertas
Los tres tamaños de LFM2.5 se ajustan en el nivel T4 de Ertas Studio, que es el nivel de GPU de entrada, y los tres quedan por debajo del límite de 5B parámetros del plan Free. Puedes entrenar el 1.2B sin pagar nada. Los modelos son nativos en bf16, así que entrenan directamente en bf16 en lugar de recurrir a fp32 como tiene que hacer Gemma 3 en hardware Turing.
Para una familia tan pequeña, la receta que funciona es una tasa de aprendizaje más alta y más épocas de las que toleraría un modelo de 7B. La guía de entrenamiento de Ertas para bases por debajo de 2B es una tasa de aprendizaje entre 3e-4 y 5e-4, tamaño de lote 4, acumulación de gradiente 2 y de 8 a 16 épocas. Los modelos pequeños necesitan más pasadas sobre los datos antes de que un comportamiento se fije, y toleran la tasa agresiva sin colapsar.
Las exportaciones salen como GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors si prefieres mantener el adaptador aparte y fusionarlo tú mismo. Un 230M ajustado en Q4_K_M ronda los 153MB, el 350M unos 229MB y el 1.2B unos 731MB. Son tamaños de descarga que puedes poner delante de un consumidor sin dar explicaciones.
Dos desarrollos de Ertas funcionan sobre esta familia en producción. [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) es un ajuste de LFM2.5-1.2B-Instruct que da diálogo generado a un aldeano de Stardew Valley, cuantizado a Q4_K_M en 697MB y ejecutándose en la propia CPU del jugador sin clave de API. Corporate Goblin es un ajuste LoRA de LFM2.5-230M, fusionado y exportado a ONNX q4, que se ejecuta enteramente en el navegador en [playground.ertas.ai](https://playground.ertas.ai) mediante transformers.js y WebGPU. Entre ambos cubren los dos extremos de la familia y las dos rutas de exportación.
Lo único que conviene saber antes de empezar: la LFM Open License v1.0 viaja con tu modelo ajustado. Es un documento de Liquid AI con sus propios términos, así que un producto comercial construido sobre una base LFM2.5 necesita que esa licencia se lea en vez de darse por supuesta.
Use Cases
La extracción de datos y la salida estructurada es el caso de uso que Liquid recomienda primero para todos los tamaños de la familia, y el perfil de benchmarks lo respalda. IFEval e IFBench altos con MMLU-Pro modesto describen un modelo que sigue la forma de una instrucción de manera fiable mientras sabe menos del mundo, que es exactamente el intercambio que quieres cuando el trabajo del modelo es convertir un documento en JSON. Los hechos vienen del documento.
Los agentes en dispositivo y la llamada a herramientas son el segundo. El 1.2B es la recomendación de Liquid para tareas agénticas y RAG, y el 230M está posicionado para canalizaciones agénticas ligeras en dispositivo. Un modelo que emite una llamada de función correcta a 213 tokens por segundo en un teléfono, sin que nada salga del dispositivo, abre patrones de asistente que una ida y vuelta a la nube hace demasiado lentos o demasiado caros de intentar.
La IA en el navegador es donde el 230M en particular se gana su sitio. Con 153MB cuantizado es una descarga inicial plausible, y exportado a ONNX se ejecuta mediante transformers.js sobre WebGPU con respaldo en WASM. Corporate Goblin es exactamente eso: un modelo de personaje que se descarga a la máquina del usuario y se ejecuta allí, sin servidor y sin coste por petición.
La IA para juegos y personajes es el patrón que demostró Chatty Valley. Una personalidad concreta, un conjunto de datos ajustado y un modelo lo bastante pequeño para que un jugador acepte la descarga. El 1.2B mantiene una conversación de varios turnos en personaje; el 350M mantiene la voz pero pierde el hilo, un hallazgo que merece leerse antes de elegir un tamaño.
Qué evitar: Liquid no recomienda explícitamente esta familia para tareas intensivas en conocimiento ni programación, y la ficha del 230M añade matemáticas avanzadas y escritura creativa a esa lista. MMLU-Pro con 20,25 para el 230M frente al 37,42 de Qwen3.5-0.8B es el número que explica por qué. Si tu tarea necesita que el modelo sepa cosas en vez de hacer cosas, mira una base más grande.
Hardware Requirements
Huellas de inferencia, todas medidas por Liquid AI en hardware concreto. El 230M funciona en 375MB en un Galaxy S25 Ultra con 1.158 tokens por segundo de prellenado y 213 de decodificación, y en 293MB en una Raspberry Pi 5 con 523 de prellenado y 42 de decodificación, cuantizado a 4 bits con 2K de contexto. El 350M funciona en 56MB en un iPhone 13 Mini con el motor Cactus a 496 de prellenado y 88 de decodificación, en 169MB en una NPU Snapdragon 8 Elite y en 434MB en un AMD Ryzen AI Max 395+ a 313 tokens por segundo de decodificación. El 1.2B ocupa 719MB en un Galaxy S25 Ultra frente a los 1.306MB de Qwen3-1.7B en el mismo dispositivo, y 856MB en un AMD Ryzen AI 9 HX 370.
Tamaños de exportación en Q4_K_M, leídos de las compilaciones GGUF publicadas por Liquid: 153MB para el 230M, 229MB para el 350M y 731MB para el 1.2B. En Q8_0 pasan a 247MB, 379MB y 1,25GB. Los pesos completos en BF16 son 462MB, 712MB y 2,34GB.
Para ajustar en Ertas, los tres tamaños entrenan en el nivel T4, que es el nivel de entrada y el que usa el plan Free. No hace falta recurrir a una A10G en ningún tamaño de esta familia, y los pesos nativos en bf16 significan que no hay penalización por recurrir a fp32 en hardware Turing.
Si entrenas en local en vez de en Ertas, QLoRA sobre el 230M y el 350M cabe cómodamente en una GPU de consumo de 6GB, y el 1.2B quiere 8GB o más. El rendimiento por paso de entrenamiento con estos tamaños es lo bastante rápido como para que iterar sobre el conjunto de datos, y no esperar a la ejecución, se convierta en el cuello de botella.
Frequently Asked Questions
- ¿Qué es LFM2.5?
- LFM2.5 es una familia de modelos de lenguaje híbridos de pesos abiertos de Liquid AI, diseñada para despliegue en dispositivo. Viene en tamaños de 230M, 350M y 1.2B parámetros, todos con una ventana de contexto de 32.768 tokens. En lugar de una pila puramente transformer, LFM2.5 intercala bloques de convolución de corto alcance con doble compuerta y bloques de atención de consultas agrupadas, lo que mantiene barata la inferencia sobre secuencias largas con recuentos de parámetros pequeños.
- ¿Qué longitud de contexto admite LFM2.5?
- Los tres tamaños de texto de LFM2.5 admiten 32.768 tokens. El 230M llegó ahí mediante una fase dedicada de extensión de contexto a 32K durante su preentrenamiento de 19T tokens.
- ¿Qué tamaño de LFM2.5 debería usar?
- Usa el 1.2B cuando el modelo tenga que mantener una conversación de varios turnos o ejecutar un bucle de agente. Usa el 350M para llamada a herramientas, extracción de datos y salida estructurada donde cada petición se sostiene sola. Usa el 230M cuando el tamaño de descarga sea la restricción determinante, como un modelo en el navegador o una app de teléfono donde todo el presupuesto de descarga son un par de cientos de megabytes.
- Nuestra propia experiencia: un 350M ajustado mantiene la voz y el formato de un personaje a la perfección pero pierde el hilo de una conversación informal tras unos pocos turnos, mientras que el 1.2B lo mantiene. Todas las métricas automáticas que ejecutamos decían que el 350M estaba bien. Solo lo detectó una prueba conversacional guionizada.
- ¿LFM2.5 es de uso comercial gratuito?
- LFM2.5 se publica bajo la LFM Open License v1.0, que es la licencia propia de Liquid AI en vez de Apache 2.0 o MIT. El uso comercial está permitido con condiciones. Como los términos difieren de las licencias permisivas estándar, lee la licencia antes de lanzar un producto comercial construido sobre una base LFM2.5. La licencia viaja con tu modelo ajustado.
- ¿Puedo ajustar LFM2.5 en el plan Free de Ertas?
- Sí. Los tres tamaños de LFM2.5 están por debajo del límite de 5B parámetros del plan Free y los tres entrenan en el nivel de GPU T4. El 1.2B es el mayor de la familia y aun así se entrena gratis.
- ¿Cuánto ocupa una exportación de LFM2.5 ajustado?
- En Q4_K_M, aproximadamente 153MB para el 230M, 229MB para el 350M y 731MB para el 1.2B. Ertas exporta como GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors. Una exportación de Chatty Valley del 1.2B se lanzó con 697MB.
- ¿Para qué no sirve LFM2.5?
- Liquid AI no recomienda la familia para tareas intensivas en conocimiento ni programación, y añade matemáticas avanzadas y escritura creativa a esa lista para el 230M. El perfil de benchmarks explica por qué: LFM2.5-230M obtiene 20,25 en MMLU-Pro frente al 37,42 de Qwen3.5-0.8B. Estos modelos siguen instrucciones y llaman herramientas bien mientras saben comparativamente poco del mundo, así que combínalos con recuperación en lugar de pedirles que recuerden datos.
Supported Quantizations
Related Resources
LFM2.5 sizes compared: 230M vs 350M vs 1.2B on-device
Chatty Valley: an on-device AI mod for Stardew Valley (Part 1)
Fine-Tuning for Indie Devs: Inside the $10 Ertas Lite Plan
Best Models for On-Device Mobile AI in 2026
llama.cpp
LM Studio
MLX
Ollama
OpenVINO
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.