검증된 정확도 · 방법 공개
SomniSense 정확도: 실제로 무엇을 검증했나요?
88.49%는 200초 연구 구간을 정상 또는 무호흡·저호흡 포함 구간으로 분류한 정확도이며, OSA 환자 진단 정확도가 아닙니다. 데이터는 참여자 40명의 80인·박에서 얻은 2,953개 구간이고, Paper E의 압축 평가는 단일 시드로 수행됐습니다. 앱의 후보는 직접 확인할 관찰 정보이지, 확정된 임상 사건이나 개인별 정확도 보장이 아닙니다.
Paper A는 라벨이 있는 1초 코골이 구간 13,538개에서 5개 시드 평균 민감도 91.67%, 정밀도 89.01%를 보고합니다. OSA 환자 단위 지표가 아닙니다. Paper A

설명용 그림이며 연구 데이터가 아닙니다. 연구 표본은 본문을 확인하세요.
SOMNISENSE가 더하는 정보
이 표시를 얼마나 믿어도 될까요?
실제 앱 화면에서는 호흡이 멈춘 듯한 구간의 시각과 모델 추정 길이, 표시된 파형과 밤 전체 위치를 확인할 수 있습니다. 앞선 소리와 다시 이어지는 소리를 들어 보세요. 200초 구간 벤치마크가 각 표시나 길이, 개인 결과의 임상적 정확성을 보장하는 것은 아닙니다.
- 멈춤과 비슷하거나 얕은 호흡과 비슷한 후보 유형, 시간 및 모델 추정 지속 시간
- 표시된 파형 구간 및 검토할 수 있는 로컬 오디오
- 밤 전체에서의 위치를 여러 밤의 최근 비교와 구조화 보고서에서 추적
휴대전화 오디오는 제한적인 웰니스 신호입니다. 후보 구간은 임상 무호흡 이벤트, AHI, 산소 측정값, 기도 원인 소견 또는 진단이 아닙니다.
과업 정의가 먼저인 이유
현재 연구는 공개 프리프린트로 제공되며 아직 동료 심사를 마치지 않았습니다. 각 주요 수치는 특정 라벨 과업, 데이터 세트, 평가 절차에 속합니다.
따라서 지표 옆에 과업을 명시하며, 벤치마크 결과를 이벤트 경계, 지속 시간, 제품 라벨, 개별 침실 또는 임상 진단에 옮겨 적용하지 않습니다. 향후 동료 심사나 확대 검증으로 결과가 바뀌면 이 페이지를 업데이트합니다.
단일 수치의 문제
반올림된 하나의 ‘정확한’ 백분율만으로는 부족합니다. 무엇에 대해 정확한지, 어떤 집단에서, 어떤 참조 라벨과 비교했는지를 물어야 합니다. 코골이 구간 분류, 호흡 구간 분류, 프로덕션 이벤트 경계, 밤 전체 지수는 각각 다른 근거가 필요한 서로 다른 질문입니다.
SomniSense는 정확도를 여러 수치로 나누고 각각을 구체적인 질문에 연결합니다. 단 하나의 벤치마크로 제품 전체를 설명할 수는 없습니다.
하나의 앱, 두 개의 지수 — 검증 수치가 나뉘는 이유
SomniSense는 매일 밤 제품이 정의한 두 지수를 생성합니다. 기반 모델 벤치마크는 서로 다른 과업을 평가합니다.
- BRI는 제품이 정의한 후보 빈도이며 연구 정확도 지표가 아닙니다. Paper E의 200초 구간 분류 정확도는 88.49%, F1은 88.06%입니다(전체 2,953구간, 단일 시드). Pruned+FT+QAT는 9,416개 매개변수, 56.4 KB입니다. 별도 CoreML Pruned+FT의 Apple M2 순전파는 0.064 ms이며 음성 전후 처리는 제외했습니다(준비 호출 20회, 측정 200회).
- SRI(Snoring Rate Index) — 시간당 코골이 이벤트 수입니다. 기반 1초 코골이 이벤트 벤치마크는 민감도 91.67%와 정밀도 89.01%를 보고합니다.
BRI와 SRI는 모두 제품이 정의한 웰니스 지수입니다. BRI는 AHI가 아니며, 구간 분류 벤치마크가 야간 지수를 구성하는 모든 이벤트를 독립적으로 검증하는 것은 아닙니다.
연구가 측정하는 것과 BRI가 실제로 하는 일
자주 혼동되는 서로 다른 세 가지가 있습니다. 우리는 이를 섞지 않으려고 합니다.
- 구간 분류(Paper E가 검증하는 것). 라벨이 지정된 200초 길이의 침대 옆 오디오 구간이 주어지면 모델은 이를 정상 또는 무호흡이나 저호흡으로 분류합니다. 프로덕션 벤치마크: 정확도 88.49%, F1 88.06%.
- 매일 밤의 BRI(앱이 매일 아침 보고하는 것). 앱은 세션 전체의 프로덕션 후보 이벤트를 집계합니다.
BRI = 호흡 불규칙 후보 이벤트 / 추정 수면 시간. 이는 제품이 정의한 음향 비율이며 임상 AHI가 아닙니다. - OSA(Obstructive Sleep Apnea) 진단 — SomniSense가 하는 일이 아니라 수면 전문의가 하는 일입니다. 수면다원검사, 주간 증상 평가와 의사의 판단에 근거한 임상 진단입니다. BRI는 데이터이고 OSA 진단은 의사의 판단입니다.
이벤트 시작, 이벤트 종료, 지속 시간, 제품 라벨, 야간 BRI, 개인 추세는 프로덕션 출력입니다. 해당 출력을 정확히 평가한 별도의 공개 분석이 없다면 200초 구간 결과로 독립적으로 검증되었다고 설명해서는 안 됩니다.
실제로 공개하는 벤치마크 수치
| 질문 | 수치 | 그 의미 |
|---|---|---|
| 라벨이 지정된 코골이 구간 중 감지기가 포착한 비율은 얼마인가요? | 91.67% | 1초 구간 코골이 이벤트 민감도(재현율), 5개 시드 평균. |
| 감지기가 코골이 구간을 표시했을 때 얼마나 자주 맞았나요? | 89.01% | 1초 구간 코골이 이벤트 정밀도, 5개 시드 평균. |
| 압축된 호흡 모델은 라벨이 지정된 구간을 얼마나 자주 정확히 분류했나요? | 88.49% | 200초 구간에서 정상과 무호흡 또는 저호흡을 분류한 프로덕션 벤치마크 정확도. |
| 호흡 구간 성능은 클래스 간에 얼마나 균형을 이루었나요? | 88.06% | 동일한 압축 프로덕션 벤치마크의 F1. Paper E는 프로덕션 민감도와 정밀도 쌍을 공개하지 않으므로 이를 추론하지 않습니다. |
연구 코퍼스에는 40명 참여자의 80개 짝지은 PSG 야간 기록(실험실 내 10 + 비강 기류 캐뉼라를 사용한 이동형 PSG 70)이 포함됩니다. 보고한 각 지표에 어떤 하위 집합, 라벨, 평가 절차가 적용되는지는 링크된 프리프린트에서 확인하세요.
논문은 PSG에서 얻은 참조 라벨을 설명합니다. 눈가림 판독 절차나 독립적인 전향적 임상 평가는 기록되어 있지 않습니다.
테스트 방법(쉬운 방법 설명)

설명용 그림이며 연구 데이터가 아닙니다. 연구 표본은 본문을 확인하세요.
Paper A는 PSG 기반 라벨에 대한 후향적 분류이며, Paper E는 파생 특징 데이터의 압축 평가입니다. 이 결과가 임상 선별 성능을 확립하지는 않습니다.
구체적으로:
- 표본은 40명의 80인·박으로, 검사실 PSG 10박과 휴대형 PSG 70박입니다. 인구 집단별 체계적인 성능 평가는 보고되지 않았습니다.
- 녹음에는 다양한 소비자용 스마트폰·태블릿 마이크와 실내 환경이 사용됐습니다. 기기별 성능이나 고정 녹음 거리는 논문에서 확립되지 않았습니다.
- 참조 자료는 음성에 대응하는 PSG 사건 주석입니다. 판독자의 구체적 자격과 눈가림 절차는 이 출처에 기록되어 있지 않습니다.
- 공개된 비교: 과업별 코골이 구간 및 호흡 구간 분류 지표. 프로덕션 이벤트 경계와 야간 지수에는 각각 별도의 평가가 필요하며 이러한 결과를 암묵적으로 물려받지 않습니다.
호흡 이벤트 감지 알고리즘은 창립자의 오랜 수면 무호흡 연구를 기반으로 합니다. SomniSense에 사용되는 버전은 스마트폰 오디오에 맞게 SomniAI LLC를 위해 처음부터 다시 학습하고 재구축했습니다. 임상 하드웨어와는 마이크, 거리, 음향 맥락이 다릅니다. 세 편의 연계 프리프린트가 방법 전체를 기록합니다. 계단식 기준선 프리프린트(다중 시드 bootstrap), Coordinate-Attention 1D 아키텍처 프리프린트(매개변수 93.2% 감소), 온디바이스 압축 프리프린트(Apple M2 Neural Engine에서 측정한 압축 호흡 분류 모델의 0.064 ms 추론)입니다. 모두 인용 가능한 DOI와 함께 Zenodo에 공개되어 있습니다(cs.LG, eess.AS). 2단계 시스템의 결합 방식과 전체 프리프린트 포트폴리오는 연구 프로그램을 확인하세요. 아키텍처 상세 내용, SDK, 하드웨어 및 임상 파트너용 라이선스를 다루는 전체 기술 허브는 apneasense.com/research에 있습니다.
한계를 솔직하게 공개
아직 모르는 것과 제가 사용자라면 알고 싶은 것은 다음과 같습니다.
- 이 코호트는 모든 사람을 대표하지 않습니다. 개인이나 대표성이 부족한 집단의 성능은 다를 수 있으며, 공개된 집계 결과가 특정 개인에게 보수적인 수치라고 가정하지 않습니다.
- 음향 환경이 중요합니다. 단단한 표면, 본인보다 더 큰 파트너의 코골이, 휴대전화로 직접 부는 선풍기처럼 침실의 음향 특성이 특이하면 모델이 사용자의 이벤트를 더 적게 포착할 수 있습니다. 방법론 논문에 테스트 조건이 기록되어 있습니다.
- 프로덕션 출력에는 출력별 검증이 필요합니다. 구간 벤치마크만으로 앱에 표시되는 모든 이벤트 경계, 지속 시간, 라벨, BRI 값 또는 추세의 정확도를 확립할 수는 없습니다.
- 18세 미만에서는 검증되지 않았습니다. 코호트는 성인만 포함했습니다.
- 프리프린트이며 아직 동료 심사 전입니다. 세 편의 연계 프리프린트가 인용 가능한 DOI와 함께 Zenodo에 공개되어 있습니다. 동료 심사 학술지 출판은 별도 절차이며 완료되면 이 페이지에 표시합니다.
해당하지 않는 것
- SomniSense는 OSA를 진단하거나 선별하지 않습니다. 임상 평가에는 PSG나 적절한 가정 검사가 쓰일 수 있습니다. 앱은 18세 미만에서 검증되지 않았습니다.
- 개인에 대한 보장이 아닙니다. 사용자의 구체적인 결과는 집단 평균과 다를 수 있습니다. 방법론 논문을 읽고 본인의 상황이 분포 안팎 어디에 해당하는지 확인하세요.
- 수면 검사를 대신하지 않습니다. 임상 AHI 기준을 BRI에 적용하지 마세요. 앱 수치와 관계없이 증상이나 우려가 있다면 전문적인 평가를 받아야 합니다.
이 문제가 맞는지 모르겠다면 증상부터 시작하세요
앱을 신뢰하기 전에 근거를 확인하러 왔다면 또 다른 출발점은 실제로 느끼는 증상입니다. 각 페이지에서 증상 뒤의 호흡 패턴과 대응 방법을 설명합니다.
이 정도 근거가 충분하다면
Free로 첫날 밤 핵심 후보 기록, 앱 이용 한도 내 기기 내 재생과 최근 7일 추세를 이용할 수 있습니다. Pro는 더 긴 기록을 더하며 첫날 밤을 직접 확인하는 핵심 경험은 Free에 남습니다. 구매 정보는 요금 페이지에서 확인하세요.
Free로 시작하기 각 벤치마크와 그 경계 검토 →