AMD compra Taalas: silicio específico por modelo
AMD acordó comprar Taalas el 6 de agosto de 2026, ocho meses después de que Nvidia licenciara Groq por $20 mil millones. Inferencia y entrenamiento se separan.
Field notes on building custom AI models: fine-tuning, on-device inference, and the cost maths behind owning your own models.
Los 594 artículos, agrupados por tema.AMD acordó comprar Taalas el 6 de agosto de 2026, ocho meses después de que Nvidia licenciara Groq por $20 mil millones. Inferencia y entrenamiento se separan.
Liquid AI publica LFM2.5 en tres tamaños. Benchmarks, tamaños de exportación y lo que aprendimos ajustando dos de ellos hasta convertirlos en productos, incluido el fallo que ninguna métrica detectó.
La forma más barata de entrenar un modelo de IA propio. Qué desbloquean $10/mes para aficionados y devs indie, qué modelos puedes entrenar y dónde se acaba.
Cómo ajusté un modelo de IA de 1.2B que corre en el dispositivo para darle a Linus diálogo de verdad dentro de Stardew Valley, funcionando en tu CPU y sin clave de API. Parte 1 del diario de desarrollo de Chatty Valley.
FunctionGemma de Google (270M) y Gemma 4 E2B (2B) son los modelos de llamada de funciones más pequeños y creíbles de 2026, bases para ajustar y enviar.
Llama Stack de Meta es la arquitectura de referencia canónica para agentes basados en Llama. Combínalo con un derivado Llama 4 ajustado y los SDKs cliente Swift/Kotlin y obtienes un stack de agentes completo ejecutándose enteramente en el teléfono del usuario.
Los desarrolladores móviles que prefieren TypeScript no tienen que usar frameworks de agentes Python. Mastra y el Vercel AI SDK más un modelo de 4B ajustado ejecutándose en el dispositivo a través de llama.cpp producen un stack completo de agentes con cero costes por token.
Phi-4-Mini, Gemma 4 E4B y Qwen3-4B en tool calling con BFCL v4, latencia en móvil y precisión tras fine-tuning, más un árbol de cuatro preguntas para elegir base.
El OpenAI Agents SDK es intencionalmente agnóstico al modelo. Cambia el cliente de OpenAI por un modelo entrenado con Ertas ejecutándose en Ollama y mantienes la experiencia de desarrollador mientras matas los costes por token. Un tutorial directo.
Pydantic AI aporta seguridad de tipos y ergonomía de FastAPI a los agentes LLM. Combínalo con un modelo de 4B ajustado ejecutándose en el dispositivo vía llama.cpp y obtienes agentes de calidad de producción en aplicaciones móviles con cero costes de API y salidas validadas por construcción.
Pydantic AI te da agentes lineales con tipado seguro y LangGraph grafos duraderos con estado. Matriz de decisión 2026 y por qué el fine-tuning mejora ambos.
Nous Research tiene dos cosas llamadas Hermes: una familia de modelos abiertos de 2025 y un framework de agentes auto-mejorables de 2026. Cuál usar y cuándo.
Una instantánea integral del ecosistema de modelos de IA de pesos abiertos a abril de 2026: el dominio de los laboratorios chinos, MoE como arquitectura por defecto, el patrón unificado de modo de razonamiento y lo que todo esto significa para los despliegues en producción.
Para abril de 2026, los laboratorios chinos ocupan los cinco primeros puestos de los modelos de pesos abiertos en los benchmarks agregados de inteligencia. El patrón no es accidental: refleja diferencias estratégicas, estructurales y económicas entre el desarrollo de IA en EE. UU. y en China que tardaron años en concretarse.
Los modelos anunciados con ventanas de contexto de 1M o 10M de tokens no retienen realmente una precisión útil de recuperación a lo largo de todo ese rango. Aquí explicamos qué significa de verdad el 'contexto efectivo', por qué importa para los despliegues en producción y cómo diseñar para sortear la brecha.
Por qué MoE es la arquitectura por defecto de los modelos insignia de pesos abiertos en 2026, qué cambió de Mixtral a DeepSeek V4 y qué implica desplegarlos.
Como ejecutar una prueba A/B justa entre tu API en la nube y modelo en el dispositivo en una app movil en vivo. Metricas, diseno de cohortes, significancia estadistica y las metricas que realmente importan.
Tres formas de agregar funciones de IA a tu aplicacion movil. APIs en la nube para prototipos rapidos, modelos en el dispositivo para produccion y arquitecturas hibridas que combinan ambas. Una guia practica con costos reales, codigo y matrices de decision.
Tres caminos para agregar IA a tu app Android. Google ML Kit para tareas comunes, APIs en la nube para capacidad completa de LLM y modelos en el dispositivo via llama.cpp para costo y privacidad. Una comparacion practica para desarrolladores Kotlin.
Las matematicas de costos que la mayoria de tutoriales de IA omiten. Tu factura de API escala linealmente con cada usuario, y los multiplicadores reales son peores de lo que la pagina de precios sugiere. Esto es lo que pasa a 1K, 10K y 100K MAU.
Como calcular el verdadero costo de IA por usuario de app movil. Comparacion de proveedores, multiplicadores ocultos y la economia unitaria que determina si tu funcion de IA es sostenible.
Los limites de tasa de OpenAI, Anthropic y Google estan disenados para uso controlado, no para apps moviles con miles de usuarios concurrentes. Aqui es donde impactan los limites y que pasa cuando lo hacen.
Las llamadas a APIs de IA agregan 500-3,000ms de latencia a cada interaccion. En movil, eso decide si los usuarios conservan la funcion o la abandonan.
Lista respaldada por investigacion de funciones de IA que impulsan retencion y engagement en apps moviles. Que quieren los usuarios, que ignoran y como priorizar funciones de IA basandose en datos de comportamiento real.
Deploy custom AI models, no ML expertise required.
Free plan, no card. Paid plans from $10/mo USD.