スマートフォンで本当にどれくらい正確なのか?
疑問を持つのはもっともです。臨床睡眠検査では、たとえば気流、酸素、胸部の動き、脳波など、複数のセンサーを使います。SomniSense は、対応する設置ガイドに従い、頭から約 1.5–3 フィート(50–90 cm)離れたナイトスタンド上のスマートフォンマイク1つを使います。ですから「それでどこまで正確にできるのか」と聞くのは、正しい問いだと思います。
正直な答えはタスクごとに異なります。マイクのモデルは定義された音響分類タスクで評価できますが、PSG は臨床的解釈のために生理信号を測ります。役割が違うため、1つの数字で製品全体を表すことはできません。
精度の数値にタスク名が必要な理由
何について正確なのかを示さなければ、大きなパーセンテージも不完全です。1秒のいびき区間の分類、ラベル付き 200 秒呼吸ウィンドウの分類、全夜の製品サマリー作成は別のタスクです。一つの根拠を別のタスクへ移してはいけません。
実際に重要な2つの数値は、反対方向に動きます。
- 感度——評価セットの参照アノテーションのうち、モデルはいくつ検出したか?
- 適合率——評価セットでモデルが検出したもののうち、参照アノテーションと一致したものはいくつか?
感度と適合率は違う方向に動くことがあります。両方を公表すれば、単一の混合指標を完全な説明とみなさず、トレードオフを理解できます。
実際の数値
率直に示します。1 秒いびきイベント検出の5シード平均は感度 91.67%、適合率 89.01%です。200 秒呼吸イベントウィンドウでは、圧縮モデルが精度 88.49%、F1 88.06%を報告しています。これらは研究コホートでの分類ベンチマークであり、今夜の SRI や BRI に対する個人精度の保証ではありません。
ここでは各数値を意図的に詳説しません。より長く慎重な説明が必要なので、ブログ向けの要約より全文を読んでほしいからです。数値ごとの説明は精度ページに、研究設計とその背後のモデル——スマートフォンがどう数値を得るのか——は研究ページにあります。
正直に弱い部分を示す
実環境の性能は、スマートフォンの置き方、室内ノイズ、マイク、パートナーの音、判定境界に近いパターンによって変わります。公表された 200 秒ウィンドウのベンチマークは、個人の BRI に一方向の保証を与えるものではありません。
ノイズ、別の就寝者、マイク近くの扇風機、対象外の年齢は、ベンチマークと個人の一晩との適合に影響します。公表コホートは成人で、SomniSense は 18 歳未満を対象としていません。
次に読む
- → SomniSense の研究——検証研究と端末内モデルを平易に説明
- → 「PSG に対して検証済み」が意味すべきこと——検査方法が数値と同じくらい重要な理由
- → 精度の全内訳——すべての指標と、そのタスクと限界
If you'd rather see your own night than read about someone else's —
It's free on both stores. Put the phone on the nightstand tonight; the report is there when you wake up.
Free basics stay available: core first-night candidate evidence, 5 audio plays per night, and a recent 7-day trend.