PRECISIÓN VALIDADA · METODOLOGÍA ABIERTA
¿Cuál es la precisión real de SomniSense?
Una única cifra de precisión redondeada oculta la tarea. Publicamos por separado los resultados de segmentos de ronquido etiquetados de 1 segundo y ventanas respiratorias etiquetadas de 200 segundos, además del tamaño y la latencia del modelo en el dispositivo. Los límites de eventos de producción, los índices nocturnos y las tendencias personales no heredan esos resultados de benchmark.
WHAT SOMNISENSE ADDS
Conecta el benchmark con la salida de producto que respalda y con la que no respalda.
La pantalla real de la app SomniSense muestra la unidad de evidencia de producción: tipo de candidato, hora y duración estimados por el modelo, forma de onda marcada, audio disponible y posición en la noche completa. El resultado publicado para ventanas de 200 segundos respalda su propia tarea de clasificación; no valida de forma independiente los límites ni la duración de cada evento de producción, el BRI personal ni un diagnóstico.
- Candidate pause-like or shallow-breathing-like type, time, and model-estimated duration
- The marked waveform region and locally available audio for review
- Whole-night position, followed across nights in recent comparisons and structured reports
Phone audio is a limited wellness signal. Candidate regions are not clinical apnea events, AHI, oxygen measurements, airway-source findings, or a diagnosis.
Por qué la definición de la tarea va primero
La investigación actual está disponible como preprints abiertos y aún no ha completado la revisión por pares. Cada cifra destacada pertenece a una tarea etiquetada, un conjunto de datos y un procedimiento de evaluación específicos.
Por eso indicamos la tarea junto a la métrica y no trasladamos un resultado de benchmark a límites o duraciones de eventos, etiquetas del producto, dormitorios individuales ni diagnósticos clínicos. Si una revisión por pares o una validación ampliada cambia un resultado, actualizaremos esta página.
El problema de una sola cifra
Un único porcentaje redondeado de «precisión» está incompleto hasta preguntar: ¿precisión en qué, sobre qué población y frente a qué etiquetas de referencia? La clasificación de segmentos de ronquido, la de ventanas respiratorias, los límites de eventos de producción y un índice de toda la noche son preguntas distintas con evidencias diferentes.
SomniSense divide la precisión en varias cifras, cada una ligada a una pregunta concreta. Ningún benchmark cuenta por sí solo toda la historia del producto.
Dos índices, una app: por qué las cifras de validación se separan así
SomniSense genera cada noche dos índices definidos por el producto. Los benchmarks de sus modelos subyacentes evalúan tareas distintas:
- BRI (Breathing Irregularity Index): patrones acústicos candidatos de irregularidad respiratoria por hora de sueño estimada. El benchmark de producción subyacente informa de 88.49% de exactitud y 88.06% de F1 en la clasificación de ventanas de 200 segundos, además de una inferencia de 56.4 KB / 0.064 ms en Apple M2 Neural Engine.
- SRI (Snoring Rate Index): eventos de ronquido por hora. El benchmark subyacente de eventos de ronquido de 1 segundo informa de 91.67% de sensibilidad y 89.01% de precisión.
Tanto BRI como SRI son índices de bienestar definidos por el producto. BRI no es AHI, y el benchmark de clasificación de ventanas no valida de forma independiente cada evento utilizado para componer un índice nocturno.
Qué mide nuestra investigación y qué hace realmente BRI
Tres cosas distintas que a menudo se confunden. Procuramos no mezclarlas:
- Clasificación de ventanas (lo que valida Paper E). Dada una ventana etiquetada de 200 segundos de audio junto a la cama, el modelo la clasifica como normal o apnea o hipopnea. Benchmark de producción: 88.49% de exactitud y 88.06% de F1.
- BRI por noche (lo que informa la app cada mañana). La app agrega eventos candidatos de producción de toda la sesión:
BRI = eventos candidatos de irregularidad respiratoria / horas de sueño estimadas. Es una tasa acústica definida por el producto, no un AHI clínico. - Diagnóstico de OSA (Obstructive Sleep Apnea): lo que hace un especialista del sueño, no SomniSense. Es un diagnóstico clínico basado en polisomnografía, evaluación de síntomas diurnos y criterio médico. BRI son datos; el diagnóstico de OSA corresponde a un médico.
El inicio y el final de los eventos, la duración, la etiqueta del producto, el BRI nocturno y las tendencias personales son salidas de producción. No deben describirse como validadas de forma independiente por el resultado de ventanas de 200 segundos salvo que otro análisis publicado evalúe esa salida exacta.
Las cifras de benchmark que sí publicamos
| La pregunta | La cifra | Qué significa |
|---|---|---|
| De los segmentos de ronquido etiquetados, ¿cuántos detectó el sistema? | 91.67% | Sensibilidad (recall) de eventos de ronquido en segmentos de 1 segundo; media de cinco semillas. |
| Cuando el detector marcó un segmento de ronquido, ¿con qué frecuencia acertó? | 89.01% | Precisión de eventos de ronquido en segmentos de 1 segundo; media de cinco semillas. |
| ¿Con qué frecuencia clasificó correctamente una ventana etiquetada el modelo respiratorio comprimido? | 88.49% | Exactitud del benchmark de producción para clasificar normal frente a apnea o hipopnea en ventanas de 200 segundos. |
| ¿Hasta qué punto estuvo equilibrado el rendimiento entre clases en las ventanas respiratorias? | 88.06% | F1 del mismo benchmark de producción comprimido. Paper E no publica un par de sensibilidad y precisión de producción, por lo que no lo inferimos. |
El corpus de investigación incluye 80 noches con PSG emparejadas de 40 participantes (10 en laboratorio + 70 PSG ambulatorias con cánula de flujo nasal). Consulta en los preprints enlazados qué subconjunto, etiquetas y procedimiento de evaluación se aplican a cada métrica publicada.
Esa última parte, «no sabían lo que habíamos dicho», es lo que significa la «evaluación ciega». No podemos entrenar antes a quienes evalúan con nuestras propias respuestas. De otro modo, la prueba sería circular.
Cómo lo probamos (la metodología, en lenguaje claro)
El rendimiento de detección se midió frente a registros de referencia PSG de noches tanto en laboratorio como ambulatorias, con anotaciones de audio realizadas por técnicos del sueño certificados. Cada segmento de audio que evaluaron se puntuó sin conocer la salida de SomniSense. Esa separación mantiene la independencia de la evaluación.
En concreto:
- Muestra: 80 noches emparejadas / 40 participantes (smartphone + PSG simultáneos): 10 PSG en laboratorio + 70 PSG ambulatorias con cánula de flujo nasal. Adultos con y sin problemas respiratorios del sueño diagnosticados. Indicamos abiertamente quién está infrarrepresentado (principalmente menores de 18, extremos graves de BMI y determinados grupos étnicos), en lugar de ocultarlo tras una cifra agregada. Quiero precisar quién no está en la cohorte porque el tamaño total de la muestra sin contexto puede inducir a error.
- Medio de grabación: smartphone junto a la cama (diversos modelos de iPhone y Android desde 2018), a 50–90 cm de la cabeza del participante.
- Referencia: PSG con canal de audio sincronizado; evaluación manual por técnicos del sueño formados según AASM, sin conocer la salida de SomniSense.
- Comparaciones publicadas: métricas específicas de clasificación de segmentos de ronquido y ventanas respiratorias. Los límites de eventos de producción y los índices nocturnos necesitan su propia evaluación y no heredan en silencio esos resultados.
El algoritmo de detección de eventos respiratorios se basa en años de investigación sobre apnea del sueño de nuestro fundador. La versión que usa SomniSense se volvió a entrenar desde cero y se reconstruyó para SomniAI LLC con el fin de procesar específicamente audio de smartphones: otro micrófono, otra distancia y otro contexto acústico que el hardware clínico. Tres preprints complementarios documentan toda la metodología: el preprint de líneas base en cascada (bootstrap con varias semillas), el de la arquitectura Coordinate-Attention 1D (reducción de parámetros del 93.2%) y el de compresión en el dispositivo (inferencia de 0.064 ms en Apple Neural Engine). Todos se publican abiertamente en Zenodo con DOI citables (cs.LG, eess.AS). Para saber cómo encaja el sistema de dos etapas y ver toda la cartera de preprints, consulta el programa de investigación. El centro técnico completo —arquitectura detallada, SDK y licencias para socios de hardware y clínicos— está en apneasense.com/research.
Limitaciones, con honestidad
Esto es lo que aún no sabemos y lo que yo querría saber si fuera el usuario:
- La cohorte no representa a todo el mundo. El rendimiento para una persona o una población infrarrepresentada puede variar; no suponemos que el resultado agregado publicado sea conservador para ninguna persona concreta.
- El entorno acústico importa. Si tu dormitorio tiene propiedades acústicas inusuales —superficies duras, una pareja que ronca más fuerte que tú o un ventilador que sopla directamente hacia el teléfono—, el modelo podría detectar menos eventos tuyos. El artículo metodológico documenta las condiciones probadas.
- Las salidas de producción necesitan validación específica. Un benchmark de ventanas no puede establecer la precisión de cada límite, duración, etiqueta, valor BRI o tendencia mostrados en la app.
- No validado para menores de 18. La cohorte solo incluyó adultos.
- Preprints, aún sin revisión por pares. Los tres preprints complementarios se publican abiertamente en Zenodo con DOI citables; la publicación en una revista revisada por pares es un proceso aparte y se indicará en esta página cuando termine.
Lo que esto no es
- No es una afirmación diagnóstica. Incluso con estas cifras, SomniSense no es un dispositivo médico ni diagnostica apnea obstructiva del sueño (OSA). El diagnóstico de OSA requiere polisomnografía, evaluación de síntomas y el criterio de un especialista del sueño. SomniSense no está validado para usuarios menores de 18.
- No es una garantía personal. Tus resultados concretos pueden diferir de los promedios poblacionales. Lee el artículo metodológico para saber si tu situación está dentro o fuera de la distribución.
- No sustituye un estudio del sueño. No apliques umbrales clínicos de AHI a BRI. Los síntomas o preocupaciones merecen una evaluación profesional independientemente del valor de la app.
¿No sabes si este es tu problema? Empieza por un síntoma
Si llegaste aquí para comprobar las evidencias antes de confiar en la app, la otra entrada es lo que sientes realmente. Cada página explica el patrón respiratorio detrás del síntoma y qué hacer al respecto:
Si este nivel de evidencia te convence
Free conserva la evidencia candidata esencial de la primera noche, 5 reproducciones de audio por noche y una tendencia reciente de 7 días. Pro añade continuidad, no el derecho básico a revisar la primera noche. Los detalles de compra están en la página de precios.
Empezar con Free Revisar cada benchmark y sus límites →