EXACTITUDE VALIDÉE · MÉTHODOLOGIE OUVERTE

Exactitude de SomniSense : qu’a-t-on mesuré ?

Le résultat de 88.49% concerne la classification de fenêtres de recherche de 200 secondes, normales ou contenant une apnée ou hypopnée, et non le diagnostic du SAOS. Le jeu comprend 2953 fenêtres issues de 80 nuits-personnes et 40 participants. Paper E évalue la compression avec une seule graine aléatoire. Les candidats de l’app restent des observations à examiner, sans confirmation clinique ni garantie individuelle.

Paper A rapporte une sensibilité de 91.67% et une précision de 89.01%, moyennes de cinq graines sur 13538 segments de ronflement étiquetés d’une seconde ; ce ne sont pas des mesures par patient atteint de SAOS. Paper A

91.67%
Sensibilité au ronflement
Segments de 1 seconde · moyenne sur 5 initialisations aléatoires
88.49%
Exactitude des fenêtres respiratoires
Fenêtres de 200 secondes · benchmark de production
56.4 KB
Pruned + FT + QAT
Pruned + FT + QAT · Paper E
Collage illustré de personnes dormant dans différentes chambres, avec un téléphone près du lit ; il ne prouve ni le dispositif de recherche ni la taille de l’échantillon.

Illustration, et non données d’étude. L’échantillon est décrit dans le texte.

CE QU’AJOUTE SOMNISENSE

Ce que le chiffre dit du passage que vous ouvrirez demain.

Cet écran réel montre une pause respiratoire possible à examiner : heure et durée estimées, forme d’onde marquée, lecture et position dans la nuit. Écoutez le son qui précède et celui qui reprend. Le résultat sur fenêtres de 200 secondes ne prouve pas que chaque passage, chaque durée ou votre résultat personnel est cliniquement exact.

  • Type candidat ressemblant à une pause ou à une respiration superficielle, heure et durée estimée par le modèle
  • La forme d’onde marquée et l’écoute des sons avant et après l’intervalle candidat
  • Position dans la nuit entière, suivie d’une nuit à l’autre dans les comparaisons récentes et les rapports structurés

L’audio du téléphone est un signal de bien-être limité. Les régions candidates ne sont ni des événements cliniques d’apnée, ni l’AHI, ni des mesures d’oxygène, ni des conclusions sur l’origine dans les voies aériennes, ni un diagnostic.

Écran réel de l’application SomniSense montrant une minute sélectionnée, des régions acoustiques candidates mises en évidence par le modèle, la forme d’onde, les commandes de lecture et la position dans la nuit entière.
Écran réel SomniSense · pause respiratoire possible, heure et durée estimées, forme d’onde, lecture et position dans la nuit

Pourquoi la définition de la tâche passe en premier

La recherche actuelle est disponible sous forme de preprints ouverts et n'a pas encore achevé l'évaluation par les pairs. Chaque chiffre phare appartient à une tâche étiquetée, un jeu de données et une procédure d'évaluation précis.

Nous indiquons donc la tâche à côté de la métrique et ne transposons pas un résultat de benchmark aux limites ou durées d'événements, aux libellés du produit, aux chambres individuelles ou au diagnostic clinique. Si une future évaluation par les pairs ou une validation élargie modifie un résultat, cette page sera mise à jour.

Le problème du chiffre unique

Un unique pourcentage arrondi de « précision » reste incomplet tant qu'on ne demande pas : précis pour quoi, sur quelle population et face à quelles étiquettes de référence ? La classification des segments de ronflement, celle des fenêtres respiratoires, les limites des événements en production et l'indice d'une nuit entière sont des questions différentes, fondées sur des preuves différentes.

SomniSense décompose la précision en plusieurs chiffres, chacun lié à une question précise. Aucun benchmark ne raconte à lui seul toute l'histoire du produit.

Deux indices, une app — pourquoi les chiffres de validation sont séparés ainsi

SomniSense produit chaque nuit deux indices définis par le produit. Les benchmarks des modèles sous-jacents évaluent des tâches différentes :

  • Le BRI est un taux de candidats propre au produit. Paper E rapporte 88.49% d’exactitude et 88.06% de F1 pour des fenêtres de 200 secondes (2953 au total ; une graine). Pruned+FT+QAT a 9416 paramètres et occupe 56.4 KB ; la configuration distincte CoreML Pruned+FT donne 0.064 ms par passage avant sur Apple M2, hors traitements audio en amont et aval (200 appels, 20 de préchauffage).
  • SRI (Snoring Rate Index) — événements de ronflement par heure. Le benchmark sous-jacent des événements de ronflement de 1 seconde indique 91.67% de sensibilité et 89.01% de précision.

BRI et SRI sont tous deux des indices de bien-être définis par le produit. BRI n'est pas AHI, et le benchmark de classification des fenêtres ne valide pas indépendamment chaque événement utilisé pour assembler un indice nocturne.

Ce que mesure notre recherche et ce que fait réellement BRI

Trois choses distinctes sont souvent confondues. Nous veillons à ne pas les mélanger :

  • Classification des fenêtres (ce que valide Paper E). À partir d'une fenêtre étiquetée de 200 secondes d'audio au chevet, le modèle la classe comme normale ou comme apnée ou hypopnée. Benchmark de production : 88.49% d'exactitude et 88.06% de F1.
  • BRI par nuit (ce que l'app indique chaque matin). L'app agrège les événements candidats en production sur toute la session : BRI = événements candidats d'irrégularité respiratoire / heures de sommeil estimées. C'est un taux acoustique défini par le produit, pas un AHI clinique.
  • Diagnostic de l’apnée obstructive du sommeil — il relève d’un professionnel de santé, pas de SomniSense. Le professionnel choisit les examens appropriés, comme une polysomnographie ou un examen à domicile lorsque celui-ci convient, puis interprète les résultats avec les symptômes et les antécédents. Le BRI ne pose pas ce diagnostic.

Le début, la fin et la durée des événements, le libellé produit, le BRI nocturne et les tendances personnelles sont des sorties de production. Elles ne doivent pas être présentées comme indépendamment validées par le résultat sur les fenêtres de 200 secondes, sauf si une analyse publiée distincte évalue cette sortie exacte.

Les chiffres de benchmark que nous publions réellement

La question Le chiffre Ce que cela signifie
Parmi les segments de ronflement étiquetés, combien le détecteur en a-t-il repérés ? 91.67% Sensibilité (rappel) des événements de ronflement sur des segments de 1 seconde ; moyenne sur cinq initialisations aléatoires.
Lorsque le détecteur signalait un segment de ronflement, à quelle fréquence avait-il raison ? 89.01% Précision des événements de ronflement sur des segments de 1 seconde ; moyenne sur cinq initialisations aléatoires.
À quelle fréquence le modèle respiratoire compressé classait-il correctement une fenêtre étiquetée ? 88.49% Exactitude du benchmark de production pour la classification normal contre apnée ou hypopnée sur des fenêtres de 200 secondes.
Dans quelle mesure les performances des fenêtres respiratoires étaient-elles équilibrées entre les classes ? 88.06% F1 du même benchmark de production compressé. Paper E ne publie pas de paire sensibilité/précision en production ; nous n'en déduisons donc aucune.

Le corpus de recherche comprend 80 nuits PSG appariées auprès de 40 participants (10 en laboratoire + 70 PSG ambulatoires avec canule de débit nasal). Consultez les preprints liés pour savoir quel sous-ensemble, quelles étiquettes et quelle procédure d'évaluation s'appliquent à chaque métrique annoncée.

Les articles décrivent des annotations de référence issues de la PSG. Ils ne documentent ni cotation en aveugle ni évaluation clinique prospective indépendante.

Comment nous avons testé (la méthode, simplement)

Illustration éditoriale : une page de carnet manuscrite et une tasse de café. Les notes illustrées ne constituent pas les données de l’étude.

Illustration, et non données d’étude. L’échantillon est décrit dans le texte.

Paper A étudie rétrospectivement une classification selon des annotations PSG ; Paper E évalue la compression sur des caractéristiques dérivées. Ces travaux n’établissent pas une performance de dépistage clinique.

Plus précisément :

  • Échantillon : 80 nuits-personnes, 40 participants, dont 10 nuits de PSG en laboratoire et 70 de PSG ambulatoire. Aucune évaluation systématique par groupe démographique n’est fournie.
  • Les enregistrements utilisent différents microphones de téléphones et tablettes grand public et différents environnements. Les articles n’établissent ni performance par appareil ni distance fixe d’enregistrement.
  • Référence : audio associé à des annotations d’événements PSG. Les sources ne précisent pas la certification des évaluateurs ni la procédure d’aveugle.
  • Comparaisons publiées : métriques de classification propres aux segments de ronflement et aux fenêtres respiratoires. Les limites des événements en production et les indices nocturnes exigent leur propre évaluation et n'héritent pas silencieusement de ces résultats.

L'algorithme de détection des événements respiratoires repose sur des années de recherche de notre fondateur sur l'apnée du sommeil. La version qui alimente SomniSense a été réentraînée à partir de zéro et reconstruite pour SomniAI LLC afin de traiter spécifiquement l'audio des smartphones — microphone, distance et contexte acoustique différents du matériel clinique. Trois preprints complémentaires documentent la méthode en intégralité : le preprint sur les références en cascade (bootstrap sur plusieurs initialisations aléatoires), celui sur l'architecture Coordinate-Attention 1D (réduction de 93.2% des paramètres) et celui sur la compression sur l'appareil (inférence de 0.064 ms sur Apple Neural Engine). Tous sont publiés ouvertement sur Zenodo avec des DOI citables (cs.LG, eess.AS). Pour comprendre l'articulation du système en deux étapes et voir l'ensemble des preprints, consultez le programme de recherche. Le centre technique complet — architecture approfondie, SDK et licences pour les partenaires matériels et cliniques — se trouve sur apneasense.com/research.

Des limites exposées honnêtement

Voici ce que nous ignorons encore et ce que je voudrais savoir si j'étais l'utilisateur :

  • La cohorte ne représente pas tout le monde. Les performances pour une personne ou une population sous-représentée peuvent différer ; nous ne supposons pas que le résultat agrégé publié soit prudent pour une personne donnée.
  • L'environnement acoustique compte. Si votre chambre possède des propriétés acoustiques inhabituelles — surfaces dures, partenaire ronflant plus fort que vous ou ventilateur soufflant directement vers le téléphone —, le modèle peut détecter moins de vos événements. L'article méthodologique décrit les conditions testées.
  • Les sorties de production nécessitent une validation propre à chaque sortie. Un benchmark de fenêtres ne peut pas établir l'exactitude de chaque limite, durée, libellé, valeur BRI ou tendance affichés dans l'app.
  • Non validé pour les moins de 18 ans. La cohorte ne comprenait que des adultes.
  • Des preprints, pas encore évalués par les pairs. Trois preprints complémentaires sont publiés ouvertement sur Zenodo avec des DOI citables ; la publication dans une revue à comité de lecture est un processus distinct qui sera indiqué ici lorsqu'il sera achevé.

Ce que ce n'est pas

  • SomniSense ne diagnostique ni ne dépiste le SAOS. L’évaluation clinique peut inclure une PSG ou un examen à domicile adapté. L’app n’est pas validée pour les moins de 18 ans.
  • Pas une garantie personnelle. Vos résultats peuvent différer des moyennes de la population. Lisez l'article méthodologique pour savoir si votre situation se trouve dans ou hors de la distribution.
  • Pas un substitut à une étude du sommeil. N'appliquez pas les seuils cliniques d'AHI au BRI. Les symptômes ou inquiétudes méritent une évaluation professionnelle, quelle que soit la valeur indiquée par l'app.

Vous ignorez si c'est votre problème ? Commencez par un symptôme

Si vous êtes ici pour vérifier les preuves avant de faire confiance à l'app, l'autre porte d'entrée est ce que vous ressentez réellement. Chaque page explique le schéma respiratoire derrière le symptôme et la conduite à tenir :

Si ce niveau de preuve vous satisfait

Free conserve les éléments essentiels de la première nuit, la lecture locale dans les limites de l’app et la tendance récente sur 7 jours. Pro prolonge l’historique ; il n’est pas nécessaire pour commencer à examiner la première nuit. Les modalités d’achat figurent sur la page Tarifs.

Commencer avec Free Examiner chaque benchmark et ses limites →

Voir comment examiner les éléments acoustiques →

Sources consultées le 6 septembre 2026: Paper E · method and code.