検証済みの精度 · 方法を公開

SomniSense は実際どのくらい正確なのか?

丸めた単一の精度値ではタスクが見えません。ラベル付き 1 秒いびき区間とラベル付き 200 秒呼吸ウィンドウの結果を別々に公表し、オンデバイスモデルのサイズとレイテンシーも示しています。本番イベントの境界、夜間指標、個人トレンドがこれらのベンチマーク結果を引き継ぐわけではありません。

91.67%
いびき感度
1 秒区間 · 5 シード平均
88.49%
呼吸ウィンドウ精度
200 秒ウィンドウ · 本番ベンチマーク
56 KB
オンデバイスモデル
推論 1 回あたり 0.064 ms · Apple Neural Engine
2 台のスマートフォンと PSG センサーケーブルを用いた自宅でのペア記録セットアップ。タスク別音響ベンチマークに使われた参照データを表しています。

WHAT SOMNISENSE ADDS

ベンチマークを、それが裏付ける製品出力と裏付けない製品出力に結び付けます。

実際の SomniSense アプリ画面には、本番環境の証拠単位が表示されます。モデル推定の候補タイプ、時刻と継続時間、マーク付き波形、利用可能な音声、夜全体での位置です。公表された 200 秒ウィンドウの結果は、その分類タスク自体を裏付けますが、本番環境の各イベント境界、継続時間、個人の BRI、診断を個別に検証するものではありません。

  • Candidate pause-like or shallow-breathing-like type, time, and model-estimated duration
  • The marked waveform region and locally available audio for review
  • Whole-night position, followed across nights in recent comparisons and structured reports

Phone audio is a limited wellness signal. Candidate regions are not clinical apnea events, AHI, oxygen measurements, airway-source findings, or a diagnosis.

Real SomniSense app screen showing a selected minute, model-highlighted candidate acoustic regions, waveform, playback controls, and whole-night position.
Real SomniSense app screen · candidate type, time, model-estimated duration, marked waveform, available audio, and whole-night position

なぜ最初にタスクを定義するのか

現在の研究は公開プレプリントとして提供され、まだ査読を完了していません。各主要数値は、特定のラベル付きタスク、データセット、評価手順に属します。

そのため、指標の横にタスクを明記し、ベンチマーク結果をイベント境界、継続時間、製品ラベル、個々の寝室、臨床診断へ持ち越しません。今後の査読や拡張検証で結果が変われば、このページを更新します。

単一数値の問題

丸めた単一の「正確」という割合だけでは不十分です。に対して、どの集団で、どの参照ラベルに照らして正確なのかを問う必要があります。いびき区間分類、呼吸ウィンドウ分類、本番イベント境界、夜全体の指標は、それぞれ証拠が異なる別の問いです。

SomniSense は精度を複数の数値に分け、それぞれを具体的な問いに結び付けています。単一のベンチマークで製品全体を説明することはできません。

1 つのアプリ、2 つの指標 — 検証数値を分ける理由

SomniSense は毎晩、製品定義の 2 つの指標を生成します。基礎となるモデルのベンチマークは異なるタスクを評価します。

  • BRI(Breathing Irregularity Index)— 推定睡眠 1 時間あたりの呼吸不規則性の候補音響パターン数。基礎となる本番ベンチマークでは、200 秒ウィンドウ分類について 88.49% の精度88.06% の F1、さらに Apple M2 Neural Engine 上での 56.4 KB/0.064 ms の推論を報告しています。
  • SRI(Snoring Rate Index)— 1 時間あたりのいびきイベント数。基礎となる 1 秒いびきイベントベンチマークでは、91.67% の感度89.01% の適合率を報告しています。

BRI と SRI はどちらも製品定義のウェルネス指標です。BRI は AHI ではなく、ウィンドウ分類ベンチマークが夜間指標を構成する各イベントを個別に検証するわけではありません。

研究が測るものと、BRI が実際に行うこと

混同されがちな 3 つの異なるものがあります。私たちは混同しないようにしています。

  • ウィンドウ分類(Paper E が検証するもの)。ラベル付きの 200 秒のベッドサイド音声ウィンドウを与えると、モデルは正常または無呼吸もしくは低呼吸に分類します。本番ベンチマーク:88.49% の精度88.06% の F1
  • 一晩ごとの BRI(アプリが毎朝報告するもの)。アプリはセッション全体の本番候補イベントを集計します。BRI = 呼吸不規則性候補イベント数/推定睡眠時間。これは製品定義の音響レートで、臨床的な AHI ではありません。
  • OSA(Obstructive Sleep Apnea)の診断 — 睡眠専門医が行うことであり、SomniSense が行うことではありません。睡眠ポリグラフ検査、日中症状の評価、医師の判断に基づく臨床診断です。BRI はデータであり、OSA の診断は医師の判断です。

イベント開始、イベント終了、継続時間、製品ラベル、夜間 BRI、個人トレンドは本番出力です。その正確な出力を評価する別の公表分析がない限り、200 秒ウィンドウの結果によって個別に検証済みと表現すべきではありません。

実際に公表しているベンチマーク数値

問い 数値 その意味
ラベル付きいびき区間のうち、検出器はいくつ捉えましたか? 91.67% 1 秒区間におけるいびきイベント感度(再現率)。5 シード平均。
検出器がいびき区間を検出したとき、どの程度正しかったですか? 89.01% 1 秒区間におけるいびきイベント適合率。5 シード平均。
圧縮呼吸モデルは、ラベル付きウィンドウをどの程度正しく分類しましたか? 88.49% 200 秒ウィンドウにおける正常対無呼吸または低呼吸分類の本番ベンチマーク精度。
呼吸ウィンドウの性能はクラス間でどの程度均衡していましたか? 88.06% 同じ圧縮本番ベンチマークの F1。Paper E は本番環境での感度と適合率の組を公表していないため、推定していません。

研究コーパスには40 人の参加者から得た 80 組の PSG 夜間記録(ラボ内 10 + 鼻気流カニューレを用いた在宅 PSG 70)が含まれます。報告した各指標に適用されるサブセット、ラベル、評価手順は、リンク先のプレプリントで確認してください。

最後の部分、つまり「私たちが何と言ったかを知らなかった」ことが「盲検評価」の意味です。評価者を私たち自身の答えで事前学習させることはありません。そうすれば試験が循環してしまうからです。

どのようにテストしたか(平易な方法説明)

手書きのノート:「70 組の夜間記録 · PSG 対スマートフォン、盲検評価 · 公開済み。」横にはコーヒーカップ。

検出性能は、ラボ内と在宅の両方の夜から得た PSG 参照記録と比較して測定し、認定睡眠技師が音声に注釈を付けました。技師が評価したすべての音声区間について、SomniSense の出力は伏せられていました。この分離によって評価の独立性が保たれます。

具体的には:

  • サンプル:80 組の夜間記録/40 人の参加者(スマートフォン + PSG を同時使用)— ラボ内 PSG 10 + 鼻気流カニューレを用いた在宅 PSG 70。睡眠呼吸に関する診断済みの懸念がある成人とない成人を含みます。集計値の陰に隠さず、過少代表の人々(主に 18 歳未満、BMI が極端に高い/低い人、一部の民族集団)を公開しています。背景のない総サンプル数は誤解を招き得るため、コホートに含まれない人を具体的に示したいと考えています。
  • 記録媒体:ベッドサイドのスマートフォン(2018 年以降のさまざまな iPhone および Android 機種)。参加者の頭から 50–90 cm。
  • グラウンドトゥルース:同期音声チャンネルを備えた PSG。AASM の訓練を受けた睡眠技師が、SomniSense の出力を伏せた状態で手動評価。
  • 公表済みの比較:タスク別のいびき区間と呼吸ウィンドウの分類指標。本番イベント境界と夜間指標にはそれぞれ独自の評価が必要で、これらの結果を暗黙に引き継ぐことはありません。

呼吸イベント検出アルゴリズムは、創業者による長年の睡眠時無呼吸研究を基盤としています。SomniSense を動かすバージョンは、スマートフォン音声専用として SomniAI LLC のためにゼロから再学習・再構築されました。臨床用ハードウェアとは、マイク、距離、音響環境が異なります。3 本の関連プレプリントが方法を完全に記録しています。カスケード型ベースラインのプレプリント(複数シードの bootstrap)、Coordinate-Attention 1D アーキテクチャのプレプリント(パラメータを 93.2% 削減)、オンデバイス圧縮のプレプリント(Apple Neural Engine 上で推論 0.064 ms)です。いずれも引用可能な DOI とともに Zenodo で公開されています(cs.LG、eess.AS)。2 段階システムの連携とプレプリント全体については、研究プログラムをご覧ください。アーキテクチャの詳細、SDK、ハードウェアおよび臨床パートナー向けライセンスを含む技術ハブは、apneasense.com/researchにあります。

限界を正直に示す

まだ分かっていないこと、そして私が利用者なら知りたいことは次のとおりです。

  • このコホートはすべての人を代表していません。個人または過少代表集団での性能は異なる可能性があります。公表された集計結果が特定の個人にとって控えめな値だとは仮定しません。
  • 音響環境は重要です。硬い表面、本人より大きなパートナーのいびき、スマートフォンへ直接風を送る扇風機など、寝室に特殊な音響特性がある場合、モデルが捉えるイベントが少なくなることがあります。方法論文にテスト条件を記載しています。
  • 本番出力には出力別の検証が必要です。ウィンドウのベンチマークだけでは、アプリに表示される各イベント境界、継続時間、ラベル、BRI 値、トレンドの精度を確立できません。
  • 18 歳未満では検証していません。コホートは成人のみです。
  • プレプリントで、まだ査読前です。3 本の関連プレプリントは引用可能な DOI とともに Zenodo で公開されています。査読付き学術誌での発表は別の過程であり、完了時にこのページへ記載します。

これは何ではないか

  • 診断の主張ではありません。これらの数値があっても、SomniSense は医療機器ではなく、閉塞性睡眠時無呼吸(OSA)を診断しません。OSA の診断には睡眠ポリグラフ検査、症状評価、睡眠専門医の判断が必要です。SomniSense は 18 歳未満の利用者では検証されていません。
  • 個人への保証ではありません。あなた自身の結果は母集団平均と異なる場合があります。方法論文を読み、ご自身の状況が分布内か分布外かを確認してください。
  • 睡眠検査の代わりではありません。臨床的な AHI 閾値を BRI に当てはめないでください。アプリの値にかかわらず、症状や懸念があれば専門家の評価を受けるべきです。

これが自分の問題か分からない場合は、症状から始める

アプリを信頼する前に証拠を確かめるためにここへ来たなら、もう一つの入口は実際に感じている症状です。各ページで症状の背景にある呼吸パターンと対応方法を説明します。

この証拠水準に納得できたら

Free では初夜の中核となる候補証拠、1 晩 5 回の音声再生、直近 7 日間のトレンドを利用できます。Pro が加えるのは継続性であり、初夜を確認する基本的な権利ではありません。購入の詳細は料金ページにあります。

Free で始める 各ベンチマークとその境界を確認 →