Tony Fadell subió al escenario del MIT Future Fest con una diapositiva que valía más que mil presentaciones: el Rabbit R1, el Humane AI Pin y el Limitless Pendant, tres dispositivos que prometieron ser asistentes personales de bolsillo y terminaron en el cajón de los olvidos. "Eran tecnología interesante para geeks, pero no resolvían ninguna necesidad real", sentenció el hombre que ayudó a poner un iPod en cada bolsillo y un termostato inteligente en millones de hogares.
El diagnóstico duele porque es obvio a posteriori: menos del 0,01 % de la población mundial ha tenido un asistente humano. El resto no sabe qué pedirle a uno digital, no sabe cómo delegar, no sabe cómo confiar. Fadell lo cuenta en primera persona: le llevó años entender cómo usar a su asistente y más años todavía entregarle el acceso a su banco, su agenda, sus contactos. La confianza no se instala con una actualización de firmware; se construye en capas, con fricción y con tiempo.
Mientras las startups queman su única bala —"en una startup tienes un solo tiro", bromeó Fadell—, la investigación técnica viene dando la razón a su escepticismo. Un trabajo presentado en la conferencia IEEE UEMCON 2025 demostró que combinar voz, visión y gestos en un mismo dispositivo mejora el reconocimiento y la latencia frente a sistemas solo de voz o solo en la nube Integration of Ai, Ar, and Voice Into Daily-Use Gadgets.
La multimodalidad no es un lujo de laboratorio: es la diferencia entre que el usuario repita el comando tres veces gritando en una cocina ruidosa y que el sistema entienda a la primera con un gesto y una frase corta.
Meta lanzó Muse, su asistente todo en uno, y un investigador encontró una vulnerabilidad grave que obligó a equipos enteros a turnos de madrugada para parcharla Meta Muse vulnerability. Cuando la seguridad se gestiona en carrera, el usuario lo percibe aunque no lea el boletín técnico.
Para Fadell, la única compañía con el rompecabezas casi completo es Apple: tiene el silicio, los sensores, la base instalada de miles de millones de dispositivos y una reputación de privacidad ganada a pulso con Face ID y el enclave seguro. Le falta el modelo propio —Siri hoy corre sobre versiones adaptadas de Gemini de Google— pero tiene la arquitectura para ejecutar la inferencia en el dispositivo, sin enviar datos sensibles a la nube. Esa es, según él, la única vía para que un agente gane confianza masiva: procesamiento local, latencia nula, privacidad por diseño.
Meta y OpenAI fabrican hardware propio precisamente porque no tienen ese imperio de sensores. Cada permiso que piden —cámara, micrófono, GPS, contactos— es una fricción que el usuario aprueba sin leer. Al final, construyen un aparato sin pantalla que se conecta por Bluetooth al teléfono y de ahí a internet: la misma nube, más intermediarios TechCrunch: Fadell on AI gadgets.
Lo que esto significa para América Latina
En la región, el smartphone es la computadora principal de hogares y pymes. Los planes de datos tienen topes, la conectividad fluctúa y la regulación de datos —LGPD en Brasil, LFPDPPP en México, Ley 1581 en Colombia— exige minimización y propósito claro. Un asistente que necesita subir audio, video y ubicación a la nube para "entender" choca con costos, velocidad y cumplimiento legal al mismo tiempo.
La lección conjunta de Fadell y el paper IEEE es concreta: la próxima ola no vendrá de un pin magnético ni de un conejo naranja. Vendrá de software que corra en el silicio que ya está en el bolsillo del usuario, que combine voz, cámara e inerciales para entender contexto sin salir del dispositivo, y que gane permiso para actuar —pagar, agendar, negociar— solo después de demostrar fiabilidad en tareas triviales y locales.
Las startups latinoamericanas que persigan el "hardware IA" sin resolver la pila de confianza on-device están replicando el error del Rabbit R1. Las que integren modelos ligeros multimodales en apps que ya usan sus clientes —banca, logística, comercio conversacional— están construyendo el asistente que la región sí puede adoptar.