Apple afirma que el Apple Watch Series 12 y el Apple Watch Ultra 4 pueden procesar audio sin crear ni almacenar grabaciones de audio en bruto. Pero «procesamiento en el dispositivo» no significa que todas las funciones se queden dentro del reloj: Shazam recibe una firma acústica y Siri Recap envía texto condensado y cifrado a Private Cloud Compute para generar sus resúmenes.

Audio Intelligence es opcional. El audio en bruto entra en un búfer protegido del Secure Exclave del chip S11 y, según Apple, se elimina después del procesamiento. La función elegida puede producir información derivada, como una firma acústica, texto o un resumen.

La respuesta corta: no hay grabación de audio, pero sí procesamiento

Apple dice que el audio no es accesible para el sistema operativo, las aplicaciones, el usuario ni la propia Apple durante ese proceso. La promesa de privacidad se refiere al audio en bruto: las funciones pueden generar otros datos necesarios para detectar sonidos, identificar música o recuperar palabras recientes.

Esta diferencia importa. El reloj no se limita a guardar o descartar una grabación completa; analiza el sonido para ofrecer una función concreta y, en algunos casos, utiliza el iPhone emparejado o servicios de Apple.

Cuatro funciones con trabajos distintos

Audio Intelligence reúne cuatro herramientas en los modelos compatibles:

  • Sound Recognition detecta sirenas, alarmas y timbres, incluso cuando el iPhone no está cerca.
  • Music Recognition con Shazam identifica música de fondo y muestra el título y el artista en Smart Stack.
  • Live Rewind recupera como texto hasta los 15 segundos anteriores de voz después de pulsar dos veces de forma deliberada la Digital Crown.
  • Siri Recap crea resúmenes generales generados por inteligencia artificial de conversaciones; no produce una transcripción completa.

Todas son funciones opcionales y deben activarse. Live Rewind tampoco transcribe continuamente en segundo plano: el usuario debe realizar la doble pulsación para recuperar el fragmento.

Dónde se procesa la información

El recorrido cambia según la función. La arquitectura descrita por Apple queda así:

FunciónQué haceDónde se procesaQué sale del dispositivoRetención descrita por Apple
Sound RecognitionDetecta sirenas, alarmas y timbresApple Watch y iPhoneNo se envía audio en brutoLos datos procesados se eliminan inmediatamente y no se crea una grabación
Music Recognition con ShazamIdentifica música de fondoSecure ExclaveUna firma acústica enviada a ShazamEl audio en bruto no se envía ni se almacena
Live RewindRecupera hasta 15 segundos de voz como textoApple Watch y iPhone; algunas acciones de Siri pueden usar Private Cloud ComputeTexto enviado de forma segura si se guarda el fragmento o se solicita una acción a SiriEl fragmento no guardado desaparece aproximadamente 30 segundos después de que la pantalla se atenúe
Siri RecapGenera un resumen general de una conversaciónSecure Exclave del Apple Watch y del iPhone emparejado, y después Private Cloud ComputeTexto condensado y cifrado, además de información contextual para generar el resumenLos resúmenes no guardados se eliminan automáticamente después de siete días

En el caso de Shazam, Apple describe la firma acústica como un resultado que no puede revertirse para recuperar el audio original. En Siri Recap, el texto condensado está diseñado para ocupar menos de la mitad de la transcripción original antes de enviarse a Private Cloud Compute.

Qué ocurre con Live Rewind y Siri Recap

Live Rewind muestra hasta 15 segundos de voz convertida en texto y requiere una doble pulsación deliberada de la Digital Crown. Cuando se activa, el Apple Watch emite un sonido, muestra una animación a pantalla completa y enseña un indicador de micrófono, incluso si el reloj está en silencio o hay auriculares conectados.

El fragmento no guardado desaparece aproximadamente 30 segundos después de que la pantalla se atenúe. Siri Recap funciona de otra manera: genera un resumen de alto nivel y los resúmenes no guardados se eliminan después de siete días.

Los fragmentos y resúmenes guardados pueden sincronizarse mediante iCloud con cifrado de extremo a extremo cuando están activados iCloud, la autenticación de doble factor y un código del dispositivo. Audio Intelligence no identifica ni atribuye cada frase a una persona concreta.

Disponibilidad, idioma y modelos compatibles

Audio Intelligence es compatible con Apple Watch Series 12 y Apple Watch Ultra 4. Sound Recognition y Music Recognition requieren un iPhone 11 o posterior, o un iPhone SE de segunda generación o posterior, con iOS 27.

Live Rewind y Siri Recap requieren uno de estos modelos: iPhone 16, iPhone 16 Plus, iPhone 16 Pro, iPhone 16 Pro Max, iPhone 17, iPhone 17e, iPhone 17 Pro, iPhone 17 Pro Max, iPhone Air, iPhone 18 Pro, iPhone 18 Pro Max o iPhone Duo.

Apple prevé que Live Rewind y Siri Recap lleguen como funciones beta más adelante en 2026, inicialmente en inglés y con más idiomas después. El despliegue inicial no incluye la Unión Europea, por lo que España queda fuera de esa primera disponibilidad.

La decisión práctica de privacidad

Si activas Audio Intelligence, la diferencia clave no está entre «todo local» y «todo en la nube», sino en el recorrido concreto de cada herramienta. Sound Recognition trabaja entre el reloj y el iPhone; Shazam recibe una firma acústica; Live Rewind puede enviar texto cuando se guarda o se solicita una acción a Siri; y Siri Recap utiliza Private Cloud Compute para generar el resumen.

Apple afirma que el audio en bruto no se graba ni se almacena. Lo que permanece o sale del dispositivo depende de la función y de si guardas el texto o el resumen.