El cerebro puede codificar dos flujos de voz simultáneos: qué revela el EEG sobre la atención auditiva
Un estudio publicado en PLOS Biology en julio de 2026 demuestra que el cerebro humano puede realizar una codificación simultánea transitoria al cambiar de atención entre dos flujos de voz en entornos complejos. Los investigadores utilizaron electroencefalografía (EEG) combinada con modelos de lenguaje (LLMs) para modelar predicciones léxicas y su correlación con la actividad cerebral, revelando procesos asimétricos de desenganche y enganche durante el cambio de foco auditivo.
Para founders que desarrollan IA conversacional, sistemas de reconocimiento automático de voz (ASR) o interfaces cerebro-computadora, este hallazgo no es solo curiosidad científica: redefine cómo debemos diseñar algoritmos que imiten la atención selectiva humana en entornos con múltiples hablantes.
¿Cómo gestiona el cerebro la atención en el "efecto cocktail party"?
El llamado "efecto cocktail party" —la capacidad de enfocarse en una conversación específica en medio del ruido— ha sido objeto de estudio durante décadas. Lo que este estudio de 2026 aporta es evidencia de que el cerebro no filtra pasivamente, sino que realiza una codificación dual transitoria durante el cambio de atención.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidadInvestigaciones previas, como el proyecto "Codificación predictiva en el efecto de fiesta de cóctel" de la Universidad de la República (Uruguay), ya habían demostrado que el procesamiento neural difiere significativamente entre el hablante atendido y el desatendido. El cerebro requiere un costo neural más elevado para procesar habla sin experiencia previa, mientras que la familiaridad semántica reduce dicho costo.
Lo crítico: la atención selectiva no opera en el oído ni en el tronco cerebral. Las regiones profundas transmiten ambas señales de forma neutral. Es en la corteza cerebral donde aparece el filtrado, actuando como un "ecualizador interno" que decide qué representación amplificar. Estudios con resonancia magnética funcional han identificado la región temporal superior izquierda y la corteza auditiva posterior izquierda como zonas clave para el procesamiento fonológico y la identificación de cambios acústicos temporales rápidos.
¿Qué significa esto para tu startup de IA o neurotecnología?
Si estás construyendo productos que involucran procesamiento de voz, atención auditiva o interfaces neurales, estos hallazgos tienen implicaciones directas y accionables.
Para startups de IA conversacional y ASR
Los sistemas actuales de reconocimiento automático de voz deben integrar mecanismos de atención selectiva inspirados en la biología. La evidencia muestra que la segregación no es solo acústica, sino semántica: depende de la experiencia previa y la predicción léxica.
Acción concreta 1: Si desarrollas ASR para entornos con múltiples hablantes (reuniones, call centers, asistentes virtuales), implementa modelos de predicción cognitiva que prioricen el flujo de voz que coincide con el contexto semántico del usuario. Esto reduce el costo computacional y mejora la precisión, imitando cómo el cerebro usa la experiencia previa para optimizar el procesamiento.
Acción concreta 2: Entrena tus modelos no solo con datos acústicos limpios, sino con escenarios de cambio de atención. El estudio revela procesos asimétricos de desenganche y enganche: tu sistema debe manejar transiciones entre hablantes de forma más sofisticada que un simple corte de audio.
Para founders de interfaces cerebro-computadora (BCI)
Si el cerebro puede codificar dos flujos (aunque con amplificación selectiva), las BCI podrían diseñarse para decodificar la intención de atención antes de decodificar el contenido léxico. Esto permite crear interfaces que "escuchan" lo que el usuario quiere escuchar, no solo lo que se dice físicamente.
Acción concreta 3: Enfoca tu desarrollo de BCI en señales de alta frecuencia cortical (bandas gamma) para identificar la intención de atención. La evidencia de que la amplificación ocurre en la corteza, no en el oído, permite extraer el flujo de voz relevante del ruido con mayor precisión.
Estado del mercado: neurotecnología aplicada a procesamiento de voz (2024-2026)
El campo de la neurotecnología de voz ha avanzado hacia el decoding de habla a partir de señales neuronales. Aunque el estudio de PLOS Biology es reciente, el ecosistema ya muestra tracción:
- Synchron (EE.UU.) ha desarrollado el stent-BCI (Stentrode) que permite a pacientes con parálisis severa comunicarse mediante texto generado por pensamiento, con avances significativos reportados en 2024-2025.
- Meta, en colaboración con instituciones de investigación, ha trabajado en interfaces neurales para decodificar voz interna (habla no articulada) utilizando EEG, con prototipos avanzados en 2024.
- Neuralink mantiene su enfoque en tecnología de chips de alta densidad como base para futuros decodificadores de voz complejos.
En términos de precisión, estudios recientes han logrado reconstruir fonemas y palabras con una precisión que supera el 50-60% en tareas de decodificación de habla interna, utilizando redes neuronales entrenadas con datos de EEG y MEG. La familiaridad semántica reduce el costo neural, lo que implica que los sistemas de decoding pueden ser más rápidos y eficientes cuando el vocabulario del usuario es predecible.
Oportunidades para founders hispanohablantes
El mercado de audiología cognitiva —campo interdisciplinario que colabora entre médicos, científicos del habla y psicólogos cognitivos— está emergiendo como espacio de innovación. Para emprendedores en LATAM y España, hay ventanas específicas:
ASR para español con atención selectiva: La mayoría de los sistemas ASR están optimizados para inglés. Desarrollar modelos que integren atención selectiva para español (con sus variantes dialectales) es una oportunidad desatendida.
BCI accesibles para comunicación asistiva: El mercado de dispositivos de comunicación para personas con parálisis o condiciones neurodegenerativas está creciendo. Startups que puedan ofrecer soluciones más económicas que las de Silicon Valley tienen ventaja en mercados emergentes.
Herramientas de diagnóstico basadas en EEG: La comprensión de cómo el cerebro procesa múltiples flujos de voz abre puertas a herramientas diagnósticas para trastornos de atención auditiva, TDAH, o condiciones relacionadas con el procesamiento del lenguaje.
Conclusión
El estudio de PLOS Biology de 2026 no es solo un avance en neurociencia básica: es una hoja de ruta para la próxima generación de tecnologías de voz y interfaces neurales. Para founders, la lección es clara: los sistemas que imiten la atención selectiva humana —con su capacidad de codificación dual transitoria y su dependencia de la predicción semántica— tendrán ventaja competitiva en entornos reales, donde el ruido y los múltiples hablantes son la norma, no la excepción.
La pregunta para tu startup no es si usar estos principios, sino cuán rápido puedes integrarlos en tu roadmap de producto antes de que competidores con mayor financiamiento lo hagan primero.
Fuentes
- EEG shows brain can simultaneous encode two speech streams - PLOS Biology
- Tu cerebro decide qué escuchas e ignora el ruido - Muy Interesante
- Codificación predictiva en el efecto de fiesta de cóctel - Universidad de la República
- Procesamiento de la Información y Audiología Cognitiva
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad














