Análisis acústico aplicado a la verificación de voz
Huella acústica de la voz: qué rasgos sobreviven a la síntesis
Del timbre al micro-ritmo: las marcas que un clon de voz no reproduce igual
Cuando alguien escucha a un interlocutor conocido, no lo reconoce solo por el color de la voz. El timbre es la capa más evidente y también la más fácil de imitar: un modelo generativo entrenado con unos minutos de audio puede reproducir la envolvente general de un hablante con bastante fidelidad. Lo que cuesta más es el resto, esa parte fina que el oído humano capta sin darse cuenta y que un verificador entrenado puede medir.
Entre esas capas finas están las micro-variaciones de tono dentro de una misma sílaba, las pausas respiratorias que aparecen en lugares predecibles para cada persona, el ruido de fricción que se cuela en las consonantes sibilantes y los patrones de coarticulación, es decir, la forma en que cada hablante encadena un fonema con el siguiente. Ninguno de esos rasgos es constante al cien por ciento, pero entre grabaciones del mismo hablante mantienen una firma reconocible.
Los sistemas de clonación actuales reproducen bien la envolvente general y dejan residuos medibles en esas capas finas. No se trata de que el audio sintético suene mal: en una escucha casual puede pasar por real. Se trata de que, al comparar la señal recibida con un patrón previo del hablante, aparecen diferencias en la distribución temporal de las pausas, en la regularidad del micro-ritmo y en la textura del ruido de fricción que no coinciden con la firma original.
No todos los rasgos se degradan por igual. Algunos se conservan bastante bien porque dependen de la envolvente espectral general, que es justo lo que el modelo aprende primero. Otros se pierden antes: las irregularidades temporales pequeñas, la variación natural de la respiración y ciertos detalles de la transición entre fonemas. Por eso la detección no se apoya en un único indicador, sino en varios combinados, y por eso conviene saber cuáles son más estables antes de construir una huella útil.
Una huella acústica pensada para verificación en tiempo real no puede depender de frases secretas ni de consignas que el atacante pueda grabar y reproducir. Tiene que basarse en propiedades que el hablante emite de forma involuntaria mientras habla con normalidad. Eso obliga a extraer los rasgos durante la propia conversación, compararlos con el patrón registrado y decidir si la señal sigue siendo la misma persona o si algo en las capas finas dejó de coincidir.
El escenario ilustrativo es sencillo: un cliente llama a su bróker, la voz suena correcta al principio y en algún tramo de la conversación la coincidencia con la huella registrada cae en varios indicadores a la vez. No hay una cifra que prometer aquí, ni una tasa de acierto que anunciar. Lo que hay es un conjunto de señales acústicas finas que, combinadas, permiten sospechar de un reemplazo sintetizado antes de que la operación avance.
Este artículo continúa el análisis del recorrido de una llamada al bróker y prepara el terreno para las decisiones operativas cuando la huella deja de coincidir.
Cómo funciona un ataque de intermediario en una llamada al bróker Verificación continua durante la llamada: cuándo bloquear y cuándo avisar