Fine-Tune LFM2.5 1.2B with Ertas
LFM2.5-1.2B-Instruct es el modelo insignia para dispositivo de Liquid AI con 1.17B parámetros, que obtiene 86,23 en IFEval y 44,35 en MMLU-Pro funcionando con menos de 1GB de memoria. Es el mayor tamaño de LFM2.5 y el que hay que elegir cuando el modelo tiene que mantener una conversación de varios turnos o dirigir un bucle de agente.
LFM2.5 1.2B at a Glance
| Nombre completo | LFM2.5-1.2B-Instruct |
|---|---|
| Desarrollador | Liquid AI |
| Parámetros | 1.17B |
| Capas | 16 (10 bloques de convolución con doble compuerta + 6 bloques GQA) |
| Presupuesto de entrenamiento | 28 billones de tokens |
| Longitud de contexto | 32.768 tokens |
| Tamaño del vocabulario | 65.536 |
| Corte de conocimiento | Mediados de 2024 |
| Idiomas | Inglés, árabe, chino, francés, alemán, japonés, coreano, español |
| Publicado | 5 de enero de 2026 |
| Licencia | LFM Open License v1.0 (lfm1.0) |
| Nivel de GPU para ajustar en Ertas | T4 |
| Entrenable en el plan Free de Ertas | Sí |
| Tamaño de exportación Q4_K_M | 731 MB |
| Réplica en Ertas | ErtasAI/LFM2.5-1.2B-Instruct |
Overview
LFM2.5-1.2B-Instruct es el mayor modelo de texto de la familia LFM2.5 de Liquid AI y el buque insignia del lanzamiento del 5 de enero de 2026. Lleva 1.17B parámetros en 16 capas, repartidas en 10 bloques de convolución de corto alcance con doble compuerta y 6 bloques de atención de consultas agrupadas, y fue preentrenado con 28 billones de tokens más una canalización de aprendizaje por refuerzo multietapa a gran escala encima.
La ventana de contexto es de 32.768 tokens y el vocabulario de 65.536, deliberadamente compacto. Con este recuento de parámetros las tablas de embeddings son buena parte del archivo, así que un vocabulario más pequeño se traduce directamente en una descarga más pequeña. Esa es en gran medida la razón por la que la exportación Q4_K_M queda en 731MB mientras que un Gemma 3 1B, sobre el papel un modelo menor, exporta en 810MB.
En qué es realmente bueno el modelo se ve en la forma de los benchmarks. Obtiene 86,23 en IFEval y 47,33 en IFBench, ambas medidas de seguimiento de instrucciones, frente a 73,68 y 21,33 de Qwen3-1.7B. En GPQA se lleva 38,89 frente a 34,85, y en MMLU-Pro 44,35 frente a 42,91. Frente a Llama 3.2 1B, la comparación más cercana por tamaño, las diferencias son mucho mayores: 86,23 contra 52,37 en IFEval y 44,35 contra 20,80 en MMLU-Pro.
Liquid recomienda el modelo para tareas agénticas, extracción de datos y RAG, y lo aparta del trabajo intensivo en conocimiento y de la programación. Es una descripción justa del perfil. Sigue instrucciones con una fiabilidad inusual para su tamaño y sabe menos del mundo que un modelo en la nube, lo que lo convierte en un buen ejecutor y una mala enciclopedia.
Existen tres puntos de control hermanos además del modelo instruct: LFM2.5-1.2B-Base para ajuste intensivo, LFM2.5-1.2B-Thinking para razonamiento con una temperatura recomendada más baja de 0,05, y LFM2.5-1.2B-JP afinado para japonés. El catálogo de Ertas lleva el punto de control instruct, replicado en `ErtasAI/LFM2.5-1.2B-Instruct`.
Key Features
El seguimiento de instrucciones con 86,23 en IFEval es la capacidad titular. Para comparar, Granite-4.0-h-1b obtiene 80,08, Qwen3-1.7B 73,68, Gemma 3 1B 63,25 y Llama 3.2 1B 52,37. IFBench, que usa restricciones más duras y menos comunes, los separa aún más: 47,33 para LFM2.5 frente a 24,93 del siguiente mejor. Si tu modelo ajustado tiene que emitir un formato concreto en cada petición, este es el eje que decide si funciona en producción.
La llamada a herramientas es nativa. El modelo escribe llamadas de función en Python entre los tokens `<|tool_call_start|>` y `<|tool_call_end|>` por defecto, interpreta el resultado de la herramienta y devuelve una respuesta en texto plano. Puedes cambiarlo a llamadas en JSON mediante el prompt de sistema si tu entorno de ejecución espera esa forma. La plantilla de chat es estilo ChatML, así que la mayoría de herramientas existentes la leen sin tratamiento especial.
La huella de memoria se mantiene por debajo de un gigabyte en todos los objetivos que midió Liquid. En un Galaxy S25 Ultra funciona en 719MB frente a los 1.306MB de Qwen3-1.7B en el mismo dispositivo, con 335 tokens por segundo de prellenado y 70 de decodificación. En un AMD Ryzen AI 9 HX 370 ocupa 856MB con 2.975 de prellenado y 116 de decodificación. En una NPU Qualcomm Dragonwing IQ9 IoT se sitúa en 0,9GB con 2.143 de prellenado y 53 de decodificación.
AIME25 con 14,00 merece leerse con honestidad. Supera a Qwen3-1.7B con 9,33 y entierra a Llama 3.2 1B con 0,33, y sigue siendo una puntuación absoluta baja. Las matemáticas de competición no son para lo que sirve un modelo de 1.2B en dispositivo. Si necesitas profundidad de razonamiento en este tamaño, el punto de control LFM2.5-1.2B-Thinking es la variante que Liquid construyó para eso.
Fine-Tuning with Ertas
LFM2.5 1.2B se ajusta en el nivel T4 de Ertas Studio y queda por debajo del límite de 5B parámetros del plan Free, así que una ejecución completa de entrenamiento no cuesta nada empezarla. Los pesos son nativos en bf16, así que no hay penalización por recurrir a fp32 en hardware Turing.
La receta que funciona para esta clase de tamaño es una tasa de aprendizaje entre 3e-4 y 5e-4, tamaño de lote 4, acumulación de gradiente 2 y de 8 a 16 épocas. Un modelo de 1.2B necesita más pasadas sobre un conjunto de datos pequeño que uno de 7B antes de que un comportamiento se fije, y tolera la tasa más alta sin colapsar.
Las exportaciones salen como GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors. La compilación Q4_K_M propia de Liquid mide 731MB; la exportación de Ertas de un adaptador ajustado fusionado con esta base se lanzó con 697MB para [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley), un mod de Stardew Valley que sustituye el diálogo fijo de un aldeano por respuestas generadas en personaje ejecutándose en la propia CPU del jugador.
Ese desarrollo es el relato público más detallado que tenemos sobre ajustar este modelo, y dos hallazgos merecen llevarse a tu propia ejecución. El primero es que el 1.2B mantiene una conversación de varios turnos mientras que el 350M de la misma familia empieza a responder preguntas que nadie hizo, y esa diferencia solo se hizo visible hablando con él. La tasa de ausencia de guiones, la tasa de fuga ante jailbreak, la distribución de longitud de frase y la degeneración salieron limpias en ambos tamaños.
El segundo trata del sesgo a estar de acuerdo. Conseguir que el modelo rechace una premisa falsa bajo presión adversaria con muestreo resultó mucho más difícil que conseguir que mantuviera una voz. El ajuste supervisado moldeó ese comportamiento sin eliminarlo, y una ronda de DPO con LoRA de 40 pares extendió el mismo techo en vez de atravesarlo. La evaluación voraz no podía ver el problema en absoluto. Si tu modelo ajustado necesita rebatir algo que el usuario afirma, presupuesta para eso específicamente y pruébalo con muestreo.
Use Cases
Los asistentes en dispositivo son el caso de uso principal. Con 719MB en un teléfono de gama alta y 70 tokens por segundo de decodificación, un 1.2B ajustado responde con ritmo conversacional sin ida y vuelta a la red y sin coste por petición. Liquid nombra las tareas agénticas, la extracción de datos y RAG como su trío recomendado, y las puntuaciones de seguimiento de instrucciones respaldan las tres.
Los agentes de llamada a herramientas que se ejecutan en local son el mejor encaje. Llamadas de función nativas en Python, una ventana de 32.768 tokens para definiciones de herramientas y resultados, y 86,23 en IFEval significan que el modelo produce de forma fiable una llamada que tu entorno puede analizar. Combínalo con recuperación para que los hechos vengan de tu índice y el modelo se ocupe de la orquestación.
La IA de juegos y personajes es el patrón que demuestra Chatty Valley. Una personalidad concreta, unos cientos de filas de entrenamiento y una descarga de 697MB que un jugador aceptará de verdad. Aquí el tamaño importa por una razón específica: el trabajo de personaje necesita coherencia conversacional a lo largo de una docena de turnos, y esa es la capacidad que el 350M pierde primero.
El procesamiento de documentos y la extracción estructurada funcionan bien cuando el texto fuente está en el prompt. Alto seguimiento de instrucciones con conocimiento del mundo moderado es exactamente el perfil que quieres para convertir un contrato, un formulario o un correo en campos estructurados.
Dónde mirar en otra parte: respuesta a preguntas intensivas en conocimiento, generación de código y matemáticas de competición. Liquid lo dice directamente, y MMLU-Pro con 44,35 junto a AIME25 con 14,00 es la evidencia. Para eso, una base de 7B u 8B del catálogo es mejor punto de partida.
Hardware Requirements
Inferencia, según las mediciones de Liquid AI. Samsung Galaxy S25 Ultra con Snapdragon Gen4: 335 tokens por segundo de prellenado, 70 de decodificación, 719MB de memoria. CPU AMD Ryzen AI 9 HX 370: 2.975 de prellenado, 116 de decodificación, 856MB. NPU Qualcomm Dragonwing IQ9 IoT: 2.143 de prellenado, 53 de decodificación, 0,9GB. Todos esos objetivos se quedan por debajo de un gigabyte.
Tamaños de exportación de las compilaciones GGUF publicadas por Liquid: 696MB en Q4_0, 731MB en Q4_K_M, 843MB en Q5_K_M, 963MB en Q6_K, 1,25GB en Q8_0 y 2,34GB en BF16. Q4_K_M es el valor por defecto que merece la pena lanzar salvo que hayas medido una razón de calidad para subir.
Para ajustar en Ertas, el nivel T4 maneja este modelo, que es el nivel de entrada y el que usa el plan Free. No hace falta una A10G.
Para ajustar en local fuera de Ertas, QLoRA sobre un 1.2B quiere 8GB de VRAM o más, lo que lo pone al alcance de una RTX 3060 de 12GB o mejor. El rendimiento por paso de entrenamiento es lo bastante rápido con este tamaño como para que iterar sobre el conjunto de datos, y no el tiempo de GPU, sea lo que lleva la semana.
Frequently Asked Questions
- ¿Qué es LFM2.5 1.2B?
- LFM2.5-1.2B-Instruct es el modelo de lenguaje insignia para dispositivo de Liquid AI, publicado el 5 de enero de 2026. Tiene 1.17B parámetros en 16 capas, mezclando 10 bloques de convolución con doble compuerta y 6 bloques de atención de consultas agrupadas, una ventana de contexto de 32.768 tokens, y fue preentrenado con 28 billones de tokens. Funciona con menos de 1GB de memoria en teléfonos, CPU y NPU.
- ¿Cómo se compara LFM2.5 1.2B con Qwen3-1.7B y Llama 3.2 1B?
- En los benchmarks publicados por Liquid AI, LFM2.5-1.2B-Instruct obtiene 86,23 en IFEval frente al 73,68 de Qwen3-1.7B y el 52,37 de Llama 3.2 1B. En IFBench obtiene 47,33 frente a 21,33 y 15,93. En MMLU-Pro, 44,35 frente a 42,91 y 20,80. En GPQA, 38,89 frente a 34,85 y 16,57. Además funciona en 719MB en un Galaxy S25 Ultra donde Qwen3-1.7B necesita 1.306MB.
- ¿Cuánto ocupa una exportación de LFM2.5 1.2B ajustado?
- Alrededor de 731MB en Q4_K_M, según la compilación GGUF publicada por Liquid AI. Una exportación de Ertas de un 1.2B ajustado para el mod de Stardew Valley Chatty Valley se lanzó con 697MB. En Q8_0 el archivo ronda 1,25GB y en BF16 son 2,34GB.
- ¿Debería usar LFM2.5 1.2B o LFM2.5 350M?
- Elige el 1.2B cuando el modelo tenga que mantener una conversación a lo largo de varios turnos o ejecutar un bucle de agente. Elige el 350M cuando cada petición se sostenga sola, como en extracción, clasificación o una única llamada a herramienta, y la descarga menor de 229MB importe.
- Hicimos esta comparación directamente mientras construíamos Chatty Valley. Un 350M ajustado mantuvo la voz y el formato del personaje de maravilla y luego perdió el hilo de una conversación informal de varios turnos, produciendo respuestas fluidas y en personaje a preguntas que no se habían hecho. Todas las métricas automáticas decían que el 350M estaba bien. Solo lo detectó una prueba conversacional guionizada.
- ¿Puedo ajustar LFM2.5 1.2B gratis en Ertas?
- Sí. Con 1.17B parámetros queda holgadamente por debajo del límite de 5B del plan Free y se entrena en el nivel de GPU T4. Para bases por debajo de 2B la receta recomendada es una tasa de aprendizaje de 3e-4 a 5e-4, tamaño de lote 4, acumulación de gradiente 2 y de 8 a 16 épocas.
- ¿LFM2.5 1.2B admite llamada a herramientas?
- Sí, de forma nativa. Escribe llamadas de función en Python entre los tokens dedicados `<|tool_call_start|>` y `<|tool_call_end|>`, ejecuta contra el resultado devuelto por la herramienta y responde en texto plano. Puedes cambiarlo a llamadas en formato JSON mediante el prompt de sistema. La plantilla de chat es estilo ChatML.
Supported Quantizations
Related Resources
LFM2.5 sizes compared: 230M vs 350M vs 1.2B on-device
Chatty Valley: an on-device AI mod for Stardew Valley (Part 1)
Fine-Tuned Tool Calling for n8n and Make.com Workflows
Building AI Agents That Work Offline: Fine-Tuned Models for Edge Automation
llama.cpp
LM Studio
MLX
Ollama
vLLM
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.