Fine-Tune LFM2.5 230M with Ertas

    LFM2.5-230M es la base más pequeña del catálogo de Ertas, destilada de LFM2.5-350M y con 43,26 en llamada a funciones BFCLv3. Exporta en 153MB cuantizado y funciona en 293MB en una Raspberry Pi 5, lo que lo convierte en el modelo a elegir cuando la propia descarga es la restricción.

    230MLiquid AI

    LFM2.5 230M at a Glance

    Nombre completoLFM2.5-230M
    DesarrolladorLiquid AI
    Parámetros230M
    Capas14 (8 bloques de convolución con doble compuerta + 6 bloques GQA)
    Presupuesto de entrenamiento19 billones de tokens, incluida una fase de extensión de contexto a 32K
    PostentrenamientoDestilado de LFM2.5-350M, luego DPO y aprendizaje por refuerzo multidominio
    Longitud de contexto32.768 tokens
    Tamaño del vocabulario65.536
    Corte de conocimientoMediados de 2024
    IdiomasInglés, árabe, chino, francés, alemán, italiano, japonés, coreano, portugués, español
    Publicado25 de junio de 2026
    LicenciaLFM Open License v1.0 (lfm1.0)
    Nivel de GPU para ajustar en ErtasT4
    Entrenable en el plan Free de Ertas
    Tamaño de exportación Q4_K_M153 MB
    Réplica en ErtasErtasAI/LFM2.5-230M

    Overview

    LFM2.5-230M es el modelo más pequeño de la familia LFM2.5 de Liquid AI y la base más pequeña del catálogo de Ertas. Publicado el 25 de junio de 2026, usa 14 capas repartidas en 8 bloques de convolución de corto alcance con doble compuerta y 6 bloques de atención de consultas agrupadas, dos bloques de convolución menos que sus hermanos mayores, y fue preentrenado con 19 billones de tokens incluida una fase dedicada de extensión de contexto a 32K.

    Se construyó por destilación en lugar de entrenarse desde cero a este tamaño. Liquid ejecutó ajuste supervisado con destilación desde LFM2.5-350M, luego optimización directa de preferencias y luego aprendizaje por refuerzo multidominio. Esa canalización es la razón por la que un modelo de 230M queda a menos de un punto de su maestro de 350M en llamada a funciones: BFCLv3 con 43,26 frente a 44,11, y BFCLv4 con 21,03 frente a 21,86.

    Frente a otros modelos de tamaño cercano los resultados aguantan. En IFEval obtiene 71,71 frente al 63,49 de Gemma 3 1B IT y el 59,94 de Qwen3.5-0.8B, ambos sustancialmente mayores. En IFBench, 38,40 frente a 20,33 y 22,87. En BFCLv3, 43,26 frente al 16,61 de Gemma 3 1B IT. En CaseReportBench, 22,51 frente a 2,28.

    La cobertura de idiomas es la más amplia de la familia con diez: inglés, árabe, chino, francés, alemán, italiano, japonés, coreano, portugués y español. La ventana de contexto es de 32.768 tokens, igual que el 350M y el 1.2B, y el vocabulario es de 65.536.

    Cuantizado a Q4_K_M el modelo exporta en 153MB. Ese número es todo el sentido de este modelo. Es lo bastante pequeño para descargarse dentro de una página web, lo bastante pequeño para empaquetarse en una app móvil sin abrir una conversación sobre el tamaño, y lo bastante pequeño para vivir en una Raspberry Pi junto a lo que sea que esa Pi esté haciendo. Liquid lo recomienda para extracción de datos y canalizaciones agénticas ligeras en dispositivo, y lo aparta del trabajo intensivo en razonamiento: matemáticas avanzadas, generación de código y escritura creativa. El catálogo de Ertas lo lleva replicado en `ErtasAI/LFM2.5-230M`.

    Key Features

    Sostener 43,26 en BFCLv3 con 230M parámetros es lo más destacado. Su maestro de 350M obtiene 44,11 y Granite 4.0-H-350M obtiene 43,07, así que la destilación arrastró casi toda la capacidad de llamada a funciones una clase de tamaño hacia abajo. Gemma 3 1B IT, con aproximadamente cuatro veces los parámetros, obtiene 16,61 en el mismo benchmark.

    El seguimiento de instrucciones sobrevive a la reducción mejor que el conocimiento del mundo. IFEval con 71,71 e IFBench con 38,40 están ambos cerca del 76,96 y el 40,69 del 350M. MMLU-Pro con 20,25 y GPQA Diamond con 25,41 es donde se nota el tamaño, y Qwen3.5-0.8B se lleva MMLU-Pro con 37,42. Ese reparto es lo útil que hay que entender de este modelo: hace lo que le dices y sabe comparativamente poco, así que pon los hechos en el prompt.

    Las cifras de despliegue son lo que ningún otro modelo del catálogo puede igualar. En un Samsung Galaxy S25 Ultra funciona en 375MB a 1.158 tokens por segundo de prellenado y 213 de decodificación. En una Raspberry Pi 5, cuantizado a 4 bits con 2K de contexto, funciona en 293MB a 523 de prellenado y 42 de decodificación. En una H100 responde a un prompt de 512 tokens en unos 50ms con concurrencia 1 y unos 205ms con concurrencia 64.

    El despliegue en navegador es genuinamente práctico con este tamaño. Exportado a ONNX y cuantizado a q4, el modelo carga mediante transformers.js y se ejecuta sobre WebGPU con respaldo en WASM, lo que significa una función de IA sin servidor y sin coste por petición. Corporate Goblin en [playground.ertas.ai](https://playground.ertas.ai) es exactamente eso: un ajuste LoRA de esta base, fusionado y exportado a ONNX q4, ejecutándose enteramente en la máquina del visitante.

    Fine-Tuning with Ertas

    LFM2.5 230M se ajusta en el nivel T4 de Ertas Studio y es el modelo más barato del catálogo de entrenar. Es nativo en bf16, así que entrena directamente en bf16. El plan Free lo cubre con holgura.

    La receta para este tamaño es una tasa de aprendizaje entre 3e-4 y 5e-4, tamaño de lote 4, acumulación de gradiente 2 y de 8 a 16 épocas. Con 230M parámetros una ejecución sobre unos cientos de filas termina lo bastante rápido como para que el paso de entrenamiento deje de ser lo que esperas, y la calidad del conjunto de datos pase a ser la única variable que importa.

    Las exportaciones salen como GGUF para llama.cpp, Ollama y LM Studio, o como adaptadores LoRA en safetensors. Una exportación Q4_K_M ronda los 153MB. Para despliegue en navegador, el adaptador puede fusionarse y convertirse a ONNX q4 para transformers.js.

    Corporate Goblin es nuestro propio ejemplo trabajado. Es un ajuste LoRA de LFM2.5-230M entrenado para responder a cada prompt con una única personalidad fija, rechazando respuestas normales y desviando en personaje. Se ejecuta en el navegador en [playground.ertas.ai](https://playground.ertas.ai) sin que nada salga del dispositivo del visitante. La lección que deja es que un modelo de 230M sostiene una personalidad concreta mucho mejor de lo que sugiere el recuento de parámetros, siempre que la tarea sea estrecha y el conjunto de datos sea consistente al respecto.

    La restricción que hay que planificar es la memoria conversacional. Un modelo tan pequeño está en su mejor momento cuando cada petición se sostiene sola. Si tu ajuste necesita que el modelo siga un estado a lo largo de varios turnos, escribe pronto una prueba guionizada de varios turnos y ejecútala contra una conversación real en vez de fiarte de métricas de un solo turno. En nuestras pruebas sobre la misma familia, los ejes automáticos se mantuvieron limpios en un tamaño que en realidad perdía el hilo, y solo la conversación lo dejó al descubierto.

    Use Cases

    La IA en el navegador es el caso de uso que este modelo desbloquea. Con 153MB cuantizado es una descarga inicial plausible, y mediante transformers.js sobre WebGPU se ejecuta enteramente en el cliente. Eso elimina el servidor, el coste por petición y la conversación sobre privacidad de una sola vez, lo que cambia lo que merece la pena construir.

    La extracción de datos a gran escala es la primera recomendación de la propia Liquid. Cada documento es una petición independiente, la respuesta viene del texto y el trabajo del modelo es producir una forma consistente. Con latencias en H100 de unos 50ms para un prompt de 512 tokens, ejecutar esto sobre un corpus grande sale lo bastante barato como para resultar poco interesante como partida de coste.

    Los agentes ligeros en dispositivo funcionan con este tamaño porque la llamada a funciones sobrevivió a la destilación. BFCLv3 con 43,26 y formato nativo de llamadas en Python significa que un agente local puede elegir la herramienta correcta de un conjunto modesto, que suele ser todo lo que un asistente embebido necesita hacer.

    El despliegue embebido y en IoT es realista. 293MB en una Raspberry Pi 5 con 42 tokens por segundo de decodificación cubre una amplia clase de hardware, desde dispositivos domésticos inteligentes hasta sensores industriales y quioscos, donde un modelo de 1B iría incómodo.

    Las funciones móviles siempre activas también encajan con la huella. Clasificación en segundo plano, ordenación de búsqueda en dispositivo, autocompletado y categorización de contenido pueden ejecutarse de forma continua en 375MB de una manera que el coste de memoria y batería de un modelo mayor descartaría.

    Dónde mirar en otra parte: conversación de varios turnos, generación de código, matemáticas, escritura creativa y cualquier cosa que necesite conocimiento del mundo. Liquid lo dice directamente y MMLU-Pro con 20,25 es el número detrás. Para trabajo conversacional en la misma familia, [LFM2.5 1.2B](/models/lfm2-5-1-2b) es el tamaño que mantiene el hilo.

    Hardware Requirements

    Inferencia, según las mediciones de Liquid AI. Samsung Galaxy S25 Ultra con Snapdragon Gen4: 1.158 tokens por segundo de prellenado, 213 de decodificación, 375MB de memoria. Raspberry Pi 5, cuantizado a 4 bits con 2K de contexto: 523 de prellenado, 42 de decodificación, 293MB. En una sola H100 sirviendo peticiones por lotes de 512 tokens de entrada y 32 de salida, la latencia p50 es de unos 50ms con concurrencia 1 y de unos 205ms con concurrencia 64.

    Tamaños de exportación de las compilaciones GGUF publicadas por Liquid: 149MB en Q4_0, 153MB en Q4_K_M, 172MB en Q5_K_M, 191MB en Q6_K, 247MB en Q8_0 y 462MB en BF16. Con este tamaño el salto de Q4_K_M a Q6_K cuesta solo 38MB, así que merece la pena probar si la calidad extra sale gratis en la práctica.

    Para ajustar en Ertas, el nivel T4 maneja este modelo de sobra. Es el nivel de entrada y el que usa el plan Free.

    Para ajustar en local fuera de Ertas, QLoRA sobre un 230M cabe en prácticamente cualquier GPU de consumo moderna, incluidas las tarjetas de 6GB, y en muchos portátiles recientes. Las ejecuciones de entrenamiento con este tamaño se completan en minutos en lugar de horas.

    Frequently Asked Questions

    ¿Qué es LFM2.5 230M?
    LFM2.5-230M es el modelo de lenguaje para dispositivo más pequeño de Liquid AI, publicado el 25 de junio de 2026. Tiene 230 millones de parámetros en 14 capas, mezclando 8 bloques de convolución con doble compuerta y 6 bloques de atención de consultas agrupadas, y una ventana de contexto de 32.768 tokens. Fue preentrenado con 19 billones de tokens, luego destilado de LFM2.5-350M y refinado con optimización directa de preferencias y aprendizaje por refuerzo multidominio.
    ¿De verdad puede un modelo de 230M llamar a funciones?
    Sí. LFM2.5-230M obtiene 43,26 en BFCLv3 y 21,03 en BFCLv4 en los resultados publicados por Liquid AI. Su maestro de 350M obtiene 44,11 y 21,86, así que la destilación preservó casi toda la capacidad. Para comparar, Gemma 3 1B IT obtiene 16,61 en BFCLv3 con aproximadamente cuatro veces los parámetros.
    ¿Cuánto ocupa una exportación de LFM2.5 230M ajustado?
    Alrededor de 153MB en Q4_K_M, según la compilación GGUF publicada por Liquid AI. Q5_K_M son 172MB, Q6_K son 191MB y Q8_0 son 247MB. Es la exportación más pequeña que Ertas produce a partir de cualquier base del catálogo.
    ¿Puede LFM2.5 230M ejecutarse en un navegador web?
    Sí. Exportado a ONNX y cuantizado a q4, se ejecuta en el cliente mediante transformers.js sobre WebGPU con respaldo en WASM. Corporate Goblin en playground.ertas.ai es un ajuste LoRA de esta base haciendo exactamente eso, sin servidor implicado y sin que nada de lo que escriba el visitante salga de su dispositivo.
    ¿Para qué no es adecuado LFM2.5 230M?
    Liquid AI no lo recomienda para cargas intensivas en razonamiento: matemáticas avanzadas, generación de código y escritura creativa. La conversación de varios turnos es el otro límite que conviene planificar, ya que un modelo de este tamaño está en su mejor momento cuando cada petición se sostiene sola. MMLU-Pro con 20,25 frente al 37,42 de Qwen3.5-0.8B muestra la brecha de conocimiento del mundo directamente, así que combínalo con recuperación en lugar de pedirle que recuerde datos.
    ¿Es gratis ajustar LFM2.5 230M en Ertas?
    Sí. Con 230 millones de parámetros es la base más pequeña y barata del catálogo, se entrena en el nivel de GPU T4 y queda muy por debajo del límite de 5B parámetros del plan Free.

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.