PRECISIÓN VALIDADA · METODOLOGÍA ABIERTA
Exactitud de SomniSense: ¿qué se evaluó?
El 88.49% de exactitud corresponde a clasificar ventanas de investigación de 200 segundos como normales o con apnea o hipopnea; no a diagnosticar personas con AOS. El conjunto contiene 2953 ventanas de 80 noches-persona y 40 participantes. Paper E evalúa la compresión con una sola semilla aleatoria. Los candidatos de la app son observaciones revisables, no episodios clínicos confirmados ni una garantía individual.
Paper A informa medias de cinco semillas de 91.67% de sensibilidad y 89.01% de precisión en 13538 segmentos etiquetados de ronquido de un segundo; no son métricas de pacientes con AOS. Paper A

Ilustración, no datos del estudio. La muestra se describe en el texto.
LO QUE APORTA SOMNISENSE
Qué dice esa cifra sobre el momento que abrirás mañana.
Esta pantalla real muestra una posible pausa que puedes revisar: hora y duración estimadas, onda marcada, reproducción y posición en la noche. Escucha el sonido previo y el que vuelve después. El resultado de ventanas de 200 segundos no demuestra que cada pausa marcada, duración o resultado personal sea clínicamente correcto.
- Tipo candidato similar a una pausa o a una respiración superficial, hora y duración estimada por el modelo
- Onda marcada y reproducción del contexto: sonido previo, intervalo silencioso candidato y vuelta del sonido
- Posición a lo largo de toda la noche, con seguimiento entre noches mediante comparaciones recientes e informes estructurados
El audio del teléfono es una señal de bienestar limitada. Las regiones candidatas no son eventos clínicos de apnea, AHI, mediciones de oxígeno, hallazgos sobre el origen en la vía aérea ni un diagnóstico.
Por qué la definición de la tarea va primero
La investigación actual está disponible como preprints abiertos y aún no ha completado la revisión por pares. Cada cifra destacada pertenece a una tarea etiquetada, un conjunto de datos y un procedimiento de evaluación específicos.
Por eso indicamos la tarea junto a la métrica y no trasladamos un resultado de benchmark a límites o duraciones de eventos, etiquetas del producto, dormitorios individuales ni diagnósticos clínicos. Si una revisión por pares o una validación ampliada cambia un resultado, actualizaremos esta página.
El problema de una sola cifra
Un único porcentaje redondeado de «precisión» está incompleto hasta preguntar: ¿precisión en qué, sobre qué población y frente a qué etiquetas de referencia? La clasificación de segmentos de ronquido, la de ventanas respiratorias, los límites de eventos de producción y un índice de toda la noche son preguntas distintas con evidencias diferentes.
SomniSense divide la precisión en varias cifras, cada una ligada a una pregunta concreta. Ningún benchmark cuenta por sí solo toda la historia del producto.
Dos índices, una app: por qué las cifras de validación se separan así
SomniSense genera cada noche dos índices definidos por el producto. Los benchmarks de sus modelos subyacentes evalúan tareas distintas:
- El BRI es una tasa de candidatos propia del producto. Paper E informa 88.49% de exactitud y 88.06% de F1 en ventanas de 200 segundos (2953 en total; una semilla). Pruned+FT+QAT tiene 9416 parámetros y ocupa 56.4 KB; otra configuración, CoreML Pruned+FT, tarda 0.064 ms por inferencia en Apple M2, sin preprocesado ni posprocesado de audio (200 llamadas, 20 de calentamiento).
- SRI (Snoring Rate Index): eventos de ronquido por hora. El benchmark subyacente de eventos de ronquido de 1 segundo informa de 91.67% de sensibilidad y 89.01% de precisión.
Tanto BRI como SRI son índices de bienestar definidos por el producto. BRI no es AHI, y el benchmark de clasificación de ventanas no valida de forma independiente cada evento utilizado para componer un índice nocturno.
Qué mide nuestra investigación y qué hace realmente BRI
Tres cosas distintas que a menudo se confunden. Procuramos no mezclarlas:
- Clasificación de ventanas (lo que valida Paper E). Dada una ventana etiquetada de 200 segundos de audio junto a la cama, el modelo la clasifica como normal o apnea o hipopnea. Benchmark de producción: 88.49% de exactitud y 88.06% de F1.
- BRI por noche (lo que informa la app cada mañana). La app agrega eventos candidatos de producción de toda la sesión:
BRI = eventos candidatos de irregularidad respiratoria / horas de sueño estimadas. Es una tasa acústica definida por el producto, no un AHI clínico. - Diagnóstico de OSA (Obstructive Sleep Apnea): lo que hace un especialista del sueño, no SomniSense. Es un diagnóstico clínico basado en polisomnografía, evaluación de síntomas diurnos y criterio médico. BRI son datos; el diagnóstico de OSA corresponde a un médico.
El inicio y el final de los eventos, la duración, la etiqueta del producto, el BRI nocturno y las tendencias personales son salidas de producción. No deben describirse como validadas de forma independiente por el resultado de ventanas de 200 segundos salvo que otro análisis publicado evalúe esa salida exacta.
Las cifras de benchmark que sí publicamos
| La pregunta | La cifra | Qué significa |
|---|---|---|
| De los segmentos de ronquido etiquetados, ¿cuántos detectó el sistema? | 91.67% | Sensibilidad (recall) de eventos de ronquido en segmentos de 1 segundo; media de cinco semillas. |
| Cuando el detector marcó un segmento de ronquido, ¿con qué frecuencia acertó? | 89.01% | Precisión de eventos de ronquido en segmentos de 1 segundo; media de cinco semillas. |
| ¿Con qué frecuencia clasificó correctamente una ventana etiquetada el modelo respiratorio comprimido? | 88.49% | Exactitud del benchmark de producción para clasificar normal frente a apnea o hipopnea en ventanas de 200 segundos. |
| ¿Hasta qué punto estuvo equilibrado el rendimiento entre clases en las ventanas respiratorias? | 88.06% | F1 del mismo benchmark de producción comprimido. Paper E no publica un par de sensibilidad y precisión de producción, por lo que no lo inferimos. |
El corpus de investigación incluye 80 noches con PSG emparejadas de 40 participantes (10 en laboratorio + 70 PSG ambulatorias con cánula de flujo nasal). Consulta en los preprints enlazados qué subconjunto, etiquetas y procedimiento de evaluación se aplican a cada métrica publicada.
Los artículos describen etiquetas de referencia derivadas de PSG. No documentan una valoración ciega ni una evaluación clínica prospectiva independiente.
Cómo lo probamos (la metodología, en lenguaje claro)

Ilustración, no datos del estudio. La muestra se describe en el texto.
Paper A estudia retrospectivamente la clasificación frente a etiquetas de PSG; Paper E evalúa la compresión con características derivadas. No establecen rendimiento de cribado clínico.
En concreto:
- Muestra: 80 noches-persona de 40 participantes, con 10 noches de PSG en laboratorio y 70 de PSG ambulatoria. No se ofrece rendimiento sistemático por grupo demográfico.
- Se usaron distintos micrófonos de teléfonos y tabletas de consumo y varios entornos. Los artículos no establecen rendimiento por dispositivo ni una distancia fija de grabación.
- Referencia: audio emparejado con anotaciones de eventos de PSG. Las fuentes no documentan la certificación concreta de los evaluadores ni el procedimiento de cegamiento.
- Comparaciones publicadas: métricas específicas de clasificación de segmentos de ronquido y ventanas respiratorias. Los límites de eventos de producción y los índices nocturnos necesitan su propia evaluación y no heredan en silencio esos resultados.
El algoritmo de detección de eventos respiratorios se basa en años de investigación sobre apnea del sueño de nuestro fundador. La versión que usa SomniSense se volvió a entrenar desde cero y se reconstruyó para SomniAI LLC con el fin de procesar específicamente audio de smartphones: otro micrófono, otra distancia y otro contexto acústico que el hardware clínico. Tres preprints complementarios documentan toda la metodología: el preprint de líneas base en cascada (bootstrap con varias semillas), el de la arquitectura Coordinate-Attention 1D (reducción de parámetros del 93.2%) y el de compresión en el dispositivo (inferencia de 0.064 ms en Apple Neural Engine). Todos se publican abiertamente en Zenodo con DOI citables (cs.LG, eess.AS). Para saber cómo encaja el sistema de dos etapas y ver toda la cartera de preprints, consulta el programa de investigación. El centro técnico completo —arquitectura detallada, SDK y licencias para socios de hardware y clínicos— está en apneasense.com/research.
Limitaciones, con honestidad
Esto es lo que aún no sabemos y lo que yo querría saber si fuera el usuario:
- La cohorte no representa a todo el mundo. El rendimiento para una persona o una población infrarrepresentada puede variar; no suponemos que el resultado agregado publicado sea conservador para ninguna persona concreta.
- El entorno acústico importa. Si tu dormitorio tiene propiedades acústicas inusuales —superficies duras, una pareja que ronca más fuerte que tú o un ventilador que sopla directamente hacia el teléfono—, el modelo podría detectar menos eventos tuyos. El artículo metodológico documenta las condiciones probadas.
- Las salidas de producción necesitan validación específica. Un benchmark de ventanas no puede establecer la precisión de cada límite, duración, etiqueta, valor BRI o tendencia mostrados en la app.
- No validado para menores de 18. La cohorte solo incluyó adultos.
- Preprints, aún sin revisión por pares. Los tres preprints complementarios se publican abiertamente en Zenodo con DOI citables; la publicación en una revista revisada por pares es un proceso aparte y se indicará en esta página cuando termine.
Lo que esto no es
- SomniSense no diagnostica ni realiza cribado de AOS. La evaluación clínica puede incluir PSG o una prueba domiciliaria adecuada. La app no está validada para menores de 18 años.
- No es una garantía personal. Tus resultados concretos pueden diferir de los promedios poblacionales. Lee el artículo metodológico para saber si tu situación está dentro o fuera de la distribución.
- No sustituye un estudio del sueño. No apliques umbrales clínicos de AHI a BRI. Los síntomas o preocupaciones merecen una evaluación profesional independientemente del valor de la app.
¿No sabes si este es tu problema? Empieza por un síntoma
Si llegaste para comprobar la evidencia antes de confiar en la app, también puedes empezar por lo que has notado. Estas guías explican qué contexto puede aportar una grabación y cuándo buscar orientación profesional, sin atribuir una causa al síntoma: