Apple afirma que el Apple Watch Series 12 y el Apple Watch Ultra 4 pueden procesar audio sin crear ni almacenar grabaciones de audio en bruto. Pero «procesamiento en el dispositivo» no significa que todas las funciones se queden dentro del reloj: Shazam recibe una firma acústica y Siri Recap envía texto condensado y cifrado a Private Cloud Compute para generar sus resúmenes.
Audio Intelligence es opcional. El audio en bruto entra en un búfer protegido del Secure Exclave del chip S11 y, según Apple, se elimina después del procesamiento. La función elegida puede producir información derivada, como una firma acústica, texto o un resumen.
La respuesta corta: no hay grabación de audio, pero sí procesamiento
Apple dice que el audio no es accesible para el sistema operativo, las aplicaciones, el usuario ni la propia Apple durante ese proceso. La promesa de privacidad se refiere al audio en bruto: las funciones pueden generar otros datos necesarios para detectar sonidos, identificar música o recuperar palabras recientes.
Esta diferencia importa. El reloj no se limita a guardar o descartar una grabación completa; analiza el sonido para ofrecer una función concreta y, en algunos casos, utiliza el iPhone emparejado o servicios de Apple.
Cuatro funciones con trabajos distintos
Audio Intelligence reúne cuatro herramientas en los modelos compatibles:
- Sound Recognition detecta sirenas, alarmas y timbres, incluso cuando el iPhone no está cerca.
- Music Recognition con Shazam identifica música de fondo y muestra el título y el artista en Smart Stack.
- Live Rewind recupera como texto hasta los 15 segundos anteriores de voz después de pulsar dos veces de forma deliberada la Digital Crown.
- Siri Recap crea resúmenes generales generados por inteligencia artificial de conversaciones; no produce una transcripción completa.
Todas son funciones opcionales y deben activarse. Live Rewind tampoco transcribe continuamente en segundo plano: el usuario debe realizar la doble pulsación para recuperar el fragmento.
Dónde se procesa la información
El recorrido cambia según la función. La arquitectura descrita por Apple queda así:
| Función | Qué hace | Dónde se procesa | Qué sale del dispositivo | Retención descrita por Apple |
| Sound Recognition | Detecta sirenas, alarmas y timbres | Apple Watch y iPhone | No se envía audio en bruto | Los datos procesados se eliminan inmediatamente y no se crea una grabación |
| Music Recognition con Shazam | Identifica música de fondo | Secure Exclave | Una firma acústica enviada a Shazam | El audio en bruto no se envía ni se almacena |
| Live Rewind | Recupera hasta 15 segundos de voz como texto | Apple Watch y iPhone; algunas acciones de Siri pueden usar Private Cloud Compute | Texto enviado de forma segura si se guarda el fragmento o se solicita una acción a Siri | El fragmento no guardado desaparece aproximadamente 30 segundos después de que la pantalla se atenúe |
| Siri Recap | Genera un resumen general de una conversación | Secure Exclave del Apple Watch y del iPhone emparejado, y después Private Cloud Compute | Texto condensado y cifrado, además de información contextual para generar el resumen | Los resúmenes no guardados se eliminan automáticamente después de siete días |
En el caso de Shazam, Apple describe la firma acústica como un resultado que no puede revertirse para recuperar el audio original. En Siri Recap, el texto condensado está diseñado para ocupar menos de la mitad de la transcripción original antes de enviarse a Private Cloud Compute.
Qué ocurre con Live Rewind y Siri Recap
Live Rewind muestra hasta 15 segundos de voz convertida en texto y requiere una doble pulsación deliberada de la Digital Crown. Cuando se activa, el Apple Watch emite un sonido, muestra una animación a pantalla completa y enseña un indicador de micrófono, incluso si el reloj está en silencio o hay auriculares conectados.
El fragmento no guardado desaparece aproximadamente 30 segundos después de que la pantalla se atenúe. Siri Recap funciona de otra manera: genera un resumen de alto nivel y los resúmenes no guardados se eliminan después de siete días.
Los fragmentos y resúmenes guardados pueden sincronizarse mediante iCloud con cifrado de extremo a extremo cuando están activados iCloud, la autenticación de doble factor y un código del dispositivo. Audio Intelligence no identifica ni atribuye cada frase a una persona concreta.
Disponibilidad, idioma y modelos compatibles
Audio Intelligence es compatible con Apple Watch Series 12 y Apple Watch Ultra 4. Sound Recognition y Music Recognition requieren un iPhone 11 o posterior, o un iPhone SE de segunda generación o posterior, con iOS 27.
Live Rewind y Siri Recap requieren uno de estos modelos: iPhone 16, iPhone 16 Plus, iPhone 16 Pro, iPhone 16 Pro Max, iPhone 17, iPhone 17e, iPhone 17 Pro, iPhone 17 Pro Max, iPhone Air, iPhone 18 Pro, iPhone 18 Pro Max o iPhone Duo.
Apple prevé que Live Rewind y Siri Recap lleguen como funciones beta más adelante en 2026, inicialmente en inglés y con más idiomas después. El despliegue inicial no incluye la Unión Europea, por lo que España queda fuera de esa primera disponibilidad.
La decisión práctica de privacidad
Si activas Audio Intelligence, la diferencia clave no está entre «todo local» y «todo en la nube», sino en el recorrido concreto de cada herramienta. Sound Recognition trabaja entre el reloj y el iPhone; Shazam recibe una firma acústica; Live Rewind puede enviar texto cuando se guarda o se solicita una acción a Siri; y Siri Recap utiliza Private Cloud Compute para generar el resumen.
Apple afirma que el audio en bruto no se graba ni se almacena. Lo que permanece o sale del dispositivo depende de la función y de si guardas el texto o el resumen.