Ertas Blog

    Field notes on building custom AI models: fine-tuning, on-device inference, and the cost maths behind owning your own models.

    Los 594 artículos, agrupados por tema.
    Industry

    AMD compra Taalas: silicio específico por modelo

    AMD acordó comprar Taalas el 6 de agosto de 2026, ocho meses después de que Nvidia licenciara Groq por $20 mil millones. Inferencia y entrenamiento se separan.

    Edward Xi Yang
    Comparison

    Tamaños de LFM2.5: 230M frente a 350M y 1.2B en dispositivo

    Liquid AI publica LFM2.5 en tres tamaños. Benchmarks, tamaños de exportación y lo que aprendimos ajustando dos de ellos hasta convertirlos en productos, incluido el fallo que ninguna métrica detectó.

    Edward Xi Yang
    Product

    Fine-Tuning para devs indie: Plan Lite de Ertas, $10/mes

    La forma más barata de entrenar un modelo de IA propio. Qué desbloquean $10/mes para aficionados y devs indie, qué modelos puedes entrenar y dónde se acaba.

    Edward Xi Yang
    Insights

    Chatty Valley: un mod de IA local para Stardew Valley (Parte 1)

    Cómo ajusté un modelo de IA de 1.2B que corre en el dispositivo para darle a Linus diálogo de verdad dentro de Stardew Valley, funcionando en tu CPU y sin clave de API. Parte 1 del diario de desarrollo de Chatty Valley.

    Edward Xi Yang
    Análisis

    Gemma 4 E2B y FunctionGemma 270M: Tool Calling

    FunctionGemma de Google (270M) y Gemma 4 E2B (2B) son los modelos de llamada de funciones más pequeños y creíbles de 2026, bases para ajustar y enviar.

    Edward Xi Yang
    Tutoriales

    Llama Stack en un Teléfono: Agentes Llama Autoalojados con un Modelo Llama 4 Ajustado

    Llama Stack de Meta es la arquitectura de referencia canónica para agentes basados en Llama. Combínalo con un derivado Llama 4 ajustado y los SDKs cliente Swift/Kotlin y obtienes un stack de agentes completo ejecutándose enteramente en el teléfono del usuario.

    Edward Xi Yang
    Tutoriales

    Mastra + Vercel AI SDK + GGUF en Dispositivo: Un Stack de Agentes Móviles TypeScript Sin Costes de API

    Los desarrolladores móviles que prefieren TypeScript no tienen que usar frameworks de agentes Python. Mastra y el Vercel AI SDK más un modelo de 4B ajustado ejecutándose en el dispositivo a través de llama.cpp producen un stack completo de agentes con cero costes por token.

    Edward Xi Yang
    Análisis

    Phi-4-Mini vs Gemma 4 vs Qwen3-4B: tool calling

    Phi-4-Mini, Gemma 4 E4B y Qwen3-4B en tool calling con BFCL v4, latencia en móvil y precisión tras fine-tuning, más un árbol de cuatro preguntas para elegir base.

    Edward Xi Yang
    Tutoriales

    Reemplazando OpenAI en el OpenAI Agents SDK con Tu Modelo Local Ajustado

    El OpenAI Agents SDK es intencionalmente agnóstico al modelo. Cambia el cliente de OpenAI por un modelo entrenado con Ertas ejecutándose en Ollama y mantienes la experiencia de desarrollador mientras matas los costes por token. Un tutorial directo.

    Edward Xi Yang
    Tutoriales

    Pydantic AI en Dispositivo: Ajusta Qwen3-4B para Agentes Móviles con Seguridad de Tipos

    Pydantic AI aporta seguridad de tipos y ergonomía de FastAPI a los agentes LLM. Combínalo con un modelo de 4B ajustado ejecutándose en el dispositivo vía llama.cpp y obtienes agentes de calidad de producción en aplicaciones móviles con cero costes de API y salidas validadas por construcción.

    Edward Xi Yang
    Comparaciones

    Pydantic AI vs LangGraph para agentes ajustados

    Pydantic AI te da agentes lineales con tipado seguro y LangGraph grafos duraderos con estado. Matriz de decisión 2026 y por qué el fine-tuning mejora ambos.

    Edward Xi Yang
    Guides

    Nous Hermes Agent vs Hermes 4: la diferencia

    Nous Research tiene dos cosas llamadas Hermes: una familia de modelos abiertos de 2025 y un framework de agentes auto-mejorables de 2026. Cuál usar y cuándo.

    Edward Xi Yang
    Industry

    El panorama de los modelos de IA de código abierto en 2026

    Una instantánea integral del ecosistema de modelos de IA de pesos abiertos a abril de 2026: el dominio de los laboratorios chinos, MoE como arquitectura por defecto, el patrón unificado de modo de razonamiento y lo que todo esto significa para los despliegues en producción.

    Edward Xi Yang
    Industry

    Por qué los laboratorios chinos dominan ahora la IA de código abierto

    Para abril de 2026, los laboratorios chinos ocupan los cinco primeros puestos de los modelos de pesos abiertos en los benchmarks agregados de inteligencia. El patrón no es accidental: refleja diferencias estratégicas, estructurales y económicas entre el desarrollo de IA en EE. UU. y en China que tardaron años en concretarse.

    Edward Xi Yang
    Technical

    El problema de la longitud de contexto efectiva: por qué 1M de tokens no es realmente 1M de tokens

    Los modelos anunciados con ventanas de contexto de 1M o 10M de tokens no retienen realmente una precisión útil de recuperación a lo largo de todo ese rango. Aquí explicamos qué significa de verdad el 'contexto efectivo', por qué importa para los despliegues en producción y cómo diseñar para sortear la brecha.

    Edward Xi Yang
    Technical

    Arquitectura de mezcla de expertos (MoE) en 2026

    Por qué MoE es la arquitectura por defecto de los modelos insignia de pesos abiertos en 2026, qué cambió de Mixtral a DeepSeek V4 y qué implica desplegarlos.

    Edward Xi Yang
    Guides

    Prueba A/B de API en la nube vs IA en el dispositivo en produccion

    Como ejecutar una prueba A/B justa entre tu API en la nube y modelo en el dispositivo en una app movil en vivo. Metricas, diseno de cohortes, significancia estadistica y las metricas que realmente importan.

    Edward Xi Yang
    Guides

    Como agregar IA a tu app movil: APIs en la nube, modelos en el dispositivo o ambos

    Tres formas de agregar funciones de IA a tu aplicacion movil. APIs en la nube para prototipos rapidos, modelos en el dispositivo para produccion y arquitecturas hibridas que combinan ambas. Una guia practica con costos reales, codigo y matrices de decision.

    Edward Xi Yang
    Guides

    IA en apps Android: ML Kit, APIs en la nube y LLMs en el dispositivo comparados

    Tres caminos para agregar IA a tu app Android. Google ML Kit para tareas comunes, APIs en la nube para capacidad completa de LLM y modelos en el dispositivo via llama.cpp para costo y privacidad. Una comparacion practica para desarrolladores Kotlin.

    Edward Xi Yang
    Insights

    Tu factura de API de IA se multiplicara por 10 cuando tu app consiga usuarios

    Las matematicas de costos que la mayoria de tutoriales de IA omiten. Tu factura de API escala linealmente con cada usuario, y los multiplicadores reales son peores de lo que la pagina de precios sugiere. Esto es lo que pasa a 1K, 10K y 100K MAU.

    Edward Xi Yang
    Insights

    Precios de API de IA para movil: El costo real por usuario

    Como calcular el verdadero costo de IA por usuario de app movil. Comparacion de proveedores, multiplicadores ocultos y la economia unitaria que determina si tu funcion de IA es sostenible.

    Edward Xi Yang
    Insights

    Los limites de tasa de APIs de IA limitaran tu app movil a escala

    Los limites de tasa de OpenAI, Anthropic y Google estan disenados para uso controlado, no para apps moviles con miles de usuarios concurrentes. Aqui es donde impactan los limites y que pasa cuando lo hacen.

    Edward Xi Yang
    Insights

    Por que tu app de IA va lenta: latencia movil

    Las llamadas a APIs de IA agregan 500-3,000ms de latencia a cada interaccion. En movil, eso decide si los usuarios conservan la funcion o la abandonan.

    Edward Xi Yang
    Insights

    Funciones de IA que los usuarios moviles realmente quieren (2026)

    Lista respaldada por investigacion de funciones de IA que impulsan retencion y engagement en apps moviles. Que quieren los usuarios, que ignoran y como priorizar funciones de IA basandose en datos de comportamiento real.

    Edward Xi Yang

    Deploy custom AI models, no ML expertise required.

    Free plan, no card. Paid plans from $10/mo USD.