已驗證準確度 · 方法公開

SomniSense 準確率:研究實際測了什麼?

88.49% 是將 200 秒研究窗口分為正常或含呼吸中止/低通氣的分類準確率,不是 OSA 患者診斷準確率。資料集有 40 位參與者、80 人夜的 2,953 個窗口;Paper E 的壓縮評估採單一隨機種子。App 內的候選仍是可自行核對的觀察,不是臨床確認事件或個人準確率保證。

Paper A 以 13,538 個已標註的 1 秒鼾聲片段評估,五個種子的平均敏感度為 91.67%、精確率為 89.01%;這不是 OSA 患者指標。 Paper A

91.67%
鼾聲敏感度
1 秒片段 · 5 個隨機種子平均值
88.49%
呼吸視窗準確度
200 秒視窗 · 正式版基準
56.4 KB
Pruned + FT + QAT
Pruned + FT + QAT · Paper E
不同臥室中,人們睡眠與床邊手機的拼貼示意圖;不作為研究配置或樣本數的證明。

示意圖,並非研究資料。研究樣本請以正文說明為準。

SOMNISENSE 補充的資訊

把基準連結到它能支持、以及不能支持的產品輸出。

SomniSense 真實 App 畫面呈現正式版的證據單位:模型估計的候選類型、時間與時長、標記波形、錄音,以及整夜位置。已發表的 200 秒視窗結果支持其本身的分類任務;它不會獨立驗證每個正式版事件的邊界、時長、個人 BRI 或診斷。

  • 候選類似停頓的或類似淺呼吸的類型、時間,以及模型估算持續時間
  • 標記的波形區域,以及可供檢視的本機音訊
  • 整夜中的位置,並在近期比較和結構化報告中跨夜追蹤

手機音訊是有限的健康訊號。候選區域不是臨床呼吸中止事件、AHI、血氧測量、氣道來源發現或診斷。

真實 SomniSense App 畫面,顯示所選分鐘、模型突顯的候選聲學區域、波形、播放控制項和整夜位置。
真實 SomniSense App 畫面 · 候選類型、時間、模型估算持續時間、標記波形、錄音和整夜位置

為什麼必須先定義任務

目前研究以公開預印本提供,尚未完成同儕審查。每個主打數字都屬於特定的標註任務、資料集與評估程序。

因此,我們會把任務寫在指標旁,不把基準結果延伸到事件邊界、時長、產品標籤、個別臥室或臨床診斷。若日後的同儕審查或擴大驗證改變結果,本頁會隨之更新。

單一數字的問題

單一四捨五入的「準確」百分比並不完整,除非先問:對什麼準確、在哪個族群、又以哪一組參考標籤為準?鼾聲片段分類、呼吸視窗分類、正式版事件邊界與整夜指數,是證據各不相同的問題。

SomniSense 將準確度拆成數個數字,每個都對應一個特定問題。沒有任何單一基準能說明產品的全貌。

一個 App、兩個指數——以及驗證數字為何要分開

SomniSense 每晚產生兩個由產品定義的指數。其底層模型基準評估不同任務:

  • BRI 是產品定義的候選頻率,不是研究準確率。Paper E 的 200 秒窗口分類準確率為 88.49%、F1 為 88.06%(共 2,953 個窗口;單一種子)。Pruned+FT+QAT 模型有 9,416 個參數、檔案 56.4 KB;另測 CoreML Pruned+FT 在 Apple M2 的前向推論為 0.064 ms,不含音訊前後處理(200 次呼叫、20 次暖機)。
  • SRI(Snoring Rate Index)——每小時鼾聲事件數。底層 1 秒鼾聲事件基準報告 91.67% 敏感度89.01% 精確率

BRI 與 SRI 都是產品定義的健康觀察指數。BRI 不是 AHI,而視窗分類基準不會獨立驗證用來組成夜間指數的每個事件。

研究測量什麼,以及 BRI 實際做什麼

三件經常被混為一談的不同事情。我們盡量不混用:

  • 視窗分類(Paper E 驗證的內容)。給定一個已標註的 200 秒床邊音訊視窗,模型將其分類為正常或呼吸暫停或呼吸不足。正式版基準:88.49% 準確度88.06% F1
  • 每晚 BRI(App 每晨報告的內容)。App 彙整整段記錄中的候選正式版事件:BRI = 候選呼吸不規則事件/估計睡眠小時。這是產品定義的聲學比率,不是臨床 AHI。
  • OSA(Obstructive Sleep Apnea)診斷——這是睡眠專科醫師做的事,不是 SomniSense 所做的事。臨床診斷依據多導睡眠檢查、日間症狀評估與醫師判斷。BRI 是資料;OSA 診斷由醫師決定。

事件開始、事件結束、時長、產品標籤、夜間 BRI 與個人趨勢都是正式版輸出。除非另有已發表分析評估該項確切輸出,否則不應描述為已由 200 秒視窗結果獨立驗證。

我們實際公布的基準數字

問題 數字 這代表什麼
在已標註的鼾聲片段中,偵測器捕捉到多少? 91.67% 1 秒片段的鼾聲事件敏感度(召回率);五個隨機種子平均值。
當偵測器標記一個鼾聲片段時,判斷正確的比例是多少? 89.01% 1 秒片段的鼾聲事件精確率;五個隨機種子平均值。
壓縮後的呼吸模型有多常正確分類已標註的視窗? 88.49% 200 秒視窗上正常與呼吸暫停或呼吸不足分類的正式版基準準確度。
呼吸視窗在各類別間的表現有多均衡? 88.06% 同一壓縮正式版基準的 F1。Paper E 未公布正式版的敏感度/精確率組合,因此我們不加以推導。

研究資料庫包含來自 40 位參與者的 80 個配對 PSG 夜晚(10 個實驗室內 + 70 個使用鼻氣流導管的居家 PSG)。請查看所連結的預印本,確認每項所報指標適用的子集、標籤與評估程序。

論文說明參照標籤來自 PSG,未記載盲法評分程序或獨立前瞻性臨床評估。

我們如何測試(白話方法說明)

筆記本與咖啡杯的示意插圖;不作為驗證樣本數的證明。

示意圖,並非研究資料。研究樣本請以正文說明為準。

Paper A 是依 PSG 衍生標籤進行回溯性分類;Paper E 在衍生特徵資料上評估壓縮。這些結果不代表已建立臨床篩檢效能。

具體而言:

  • 樣本:40 位參與者、80 人夜,其中 10 個實驗室 PSG 夜晚與 70 個居家攜帶式 PSG 夜晚。論文未提供各人口族群的系統性效能評估。
  • 錄音使用不同消費型手機與平板麥克風及房間環境。論文未建立各機型效能或固定錄音距離。
  • 參照:音訊與 PSG 事件標註配對。這些來源未記載評分人員的具體資格或盲法程序。
  • 已發表比較:任務專屬的鼾聲片段與呼吸視窗分類指標。正式版事件邊界與夜間指數需要各自的評估,不會暗中繼承這些結果。

呼吸事件偵測演算法建立在創辦人多年的睡眠呼吸暫停研究上。SomniSense 使用的版本由零開始重新訓練,並為 SomniAI LLC 重建,專門處理智慧型手機音訊——它的麥克風、距離與聲學情境都不同於臨床硬體。三篇配套預印本完整記錄方法:串聯基準預印本(多隨機種子 bootstrap)、Coordinate-Attention 1D 架構預印本(參數減少 93.2%),以及裝置端壓縮預印本(Apple Neural Engine 上每次推論 0.064 ms)。全文都以可引用 DOI 公開發表於 Zenodo(cs.LG、eess.AS)。如要了解兩階段系統如何配合及完整預印本組合,請查看研究計畫。完整技術中心——深入架構、SDK,以及供硬體和臨床合作夥伴使用的授權——位於 apneasense.com/research

誠實說明限制

以下是我們仍不知道的事,也是如果我是使用者會想知道的事:

  • 此群組無法代表所有人。個人或代表不足族群的表現可能不同;我們不假設已發表的彙總結果對任何特定個人而言都偏保守。
  • 聲學環境很重要。如果你的臥室有不尋常的聲學特性——硬質表面、伴侶的鼾聲比你更大,或風扇直接吹向手機——模型可能會少捕捉一些你的事件。方法論文記錄了我們測試的條件。
  • 正式版輸出需要針對輸出的驗證。視窗基準無法確立 App 中每個事件邊界、時長、標籤、BRI 值或趨勢的準確度。
  • 尚未針對未滿 18 歲者驗證。群組僅包含成人。
  • 屬於預印本,尚未同儕審查。三篇配套預印本已在 Zenodo 以可引用 DOI 公開發表;同儕審查期刊發表是另一個流程,完成時會在本頁註明。

這不是什麼

  • SomniSense 不診斷或篩檢 OSA。臨床評估可能採用 PSG 或合適的居家睡眠呼吸中止檢查。App 未針對未滿 18 歲使用者驗證。
  • 不是個人保證。你的特定結果可能不同於族群平均值。請閱讀方法論文,了解你的情境是否落在資料分布內。
  • 不能取代睡眠檢查。請勿把臨床 AHI 閾值套用到 BRI。無論 App 顯示的數值如何,症狀或疑慮都值得尋求專業評估。

不確定這是不是你的問題?從症狀開始

如果你來這裡是想在信任 App 前檢查證據,另一個入口就是你實際感受到的情況。以下各頁會說明症狀背後的呼吸模式及可以採取的行動:

了解限制後,從自己的第一晚開始

Free 保留首晚的核心候選證據、首夜核心音訊回放和近期 7 天趨勢。Pro 增加的是連續性,不會剝奪檢視首晚結果的基本權利。購買詳情請見定價頁面

從 Free 開始 逐項查看基準及其邊界 →

看看如何核對證據 →

資料來源核對日期:2026 年 9 月 6 日: Paper E · method and code.