검증된 정확도 · 방법 공개
SomniSense는 실제로 얼마나 정확할까요?
반올림한 하나의 정확도 수치는 과업을 가립니다. 라벨이 지정된 1초 코골이 구간과 200초 호흡 구간의 결과를 따로 공개하고, 온디바이스 모델의 크기와 지연 시간도 함께 밝힙니다. 프로덕션 이벤트 경계, 야간 지수, 개인 추세가 이러한 벤치마크 결과를 그대로 물려받지는 않습니다.
WHAT SOMNISENSE ADDS
벤치마크를 그것이 뒷받침하는 제품 출력과 뒷받침하지 않는 출력에 연결합니다.
실제 SomniSense 앱 화면에는 프로덕션 근거 단위가 표시됩니다. 모델 추정 후보 유형, 시간과 지속 시간, 표시된 파형, 이용 가능한 오디오, 밤 전체에서의 위치입니다. 공개된 200초 구간 결과는 자체 분류 과업을 뒷받침하지만, 각 프로덕션 이벤트의 경계, 지속 시간, 개인 BRI 또는 진단을 독립적으로 검증하지는 않습니다.
- Candidate pause-like or shallow-breathing-like type, time, and model-estimated duration
- The marked waveform region and locally available audio for review
- Whole-night position, followed across nights in recent comparisons and structured reports
Phone audio is a limited wellness signal. Candidate regions are not clinical apnea events, AHI, oxygen measurements, airway-source findings, or a diagnosis.
과업 정의가 먼저인 이유
현재 연구는 공개 프리프린트로 제공되며 아직 동료 심사를 마치지 않았습니다. 각 주요 수치는 특정 라벨 과업, 데이터 세트, 평가 절차에 속합니다.
따라서 지표 옆에 과업을 명시하며, 벤치마크 결과를 이벤트 경계, 지속 시간, 제품 라벨, 개별 침실 또는 임상 진단에 옮겨 적용하지 않습니다. 향후 동료 심사나 확대 검증으로 결과가 바뀌면 이 페이지를 업데이트합니다.
단일 수치의 문제
반올림된 하나의 ‘정확한’ 백분율만으로는 부족합니다. 무엇에 대해 정확한지, 어떤 집단에서, 어떤 참조 라벨과 비교했는지를 물어야 합니다. 코골이 구간 분류, 호흡 구간 분류, 프로덕션 이벤트 경계, 밤 전체 지수는 각각 다른 근거가 필요한 서로 다른 질문입니다.
SomniSense는 정확도를 여러 수치로 나누고 각각을 구체적인 질문에 연결합니다. 단 하나의 벤치마크로 제품 전체를 설명할 수는 없습니다.
하나의 앱, 두 개의 지수 — 검증 수치가 나뉘는 이유
SomniSense는 매일 밤 제품이 정의한 두 지수를 생성합니다. 기반 모델 벤치마크는 서로 다른 과업을 평가합니다.
- BRI(Breathing Irregularity Index) — 추정 수면 시간당 호흡 불규칙 후보 음향 패턴 수입니다. 기반 프로덕션 벤치마크는 200초 구간 분류에서 정확도 88.49%와 F1 88.06%, Apple M2 Neural Engine에서 56.4 KB / 0.064 ms 추론을 보고합니다.
- SRI(Snoring Rate Index) — 시간당 코골이 이벤트 수입니다. 기반 1초 코골이 이벤트 벤치마크는 민감도 91.67%와 정밀도 89.01%를 보고합니다.
BRI와 SRI는 모두 제품이 정의한 웰니스 지수입니다. BRI는 AHI가 아니며, 구간 분류 벤치마크가 야간 지수를 구성하는 모든 이벤트를 독립적으로 검증하는 것은 아닙니다.
연구가 측정하는 것과 BRI가 실제로 하는 일
자주 혼동되는 서로 다른 세 가지가 있습니다. 우리는 이를 섞지 않으려고 합니다.
- 구간 분류(Paper E가 검증하는 것). 라벨이 지정된 200초 길이의 침대 옆 오디오 구간이 주어지면 모델은 이를 정상 또는 무호흡이나 저호흡으로 분류합니다. 프로덕션 벤치마크: 정확도 88.49%, F1 88.06%.
- 매일 밤의 BRI(앱이 매일 아침 보고하는 것). 앱은 세션 전체의 프로덕션 후보 이벤트를 집계합니다.
BRI = 호흡 불규칙 후보 이벤트 / 추정 수면 시간. 이는 제품이 정의한 음향 비율이며 임상 AHI가 아닙니다. - OSA(Obstructive Sleep Apnea) 진단 — SomniSense가 하는 일이 아니라 수면 전문의가 하는 일입니다. 수면다원검사, 주간 증상 평가와 의사의 판단에 근거한 임상 진단입니다. BRI는 데이터이고 OSA 진단은 의사의 판단입니다.
이벤트 시작, 이벤트 종료, 지속 시간, 제품 라벨, 야간 BRI, 개인 추세는 프로덕션 출력입니다. 해당 출력을 정확히 평가한 별도의 공개 분석이 없다면 200초 구간 결과로 독립적으로 검증되었다고 설명해서는 안 됩니다.
실제로 공개하는 벤치마크 수치
| 질문 | 수치 | 그 의미 |
|---|---|---|
| 라벨이 지정된 코골이 구간 중 감지기가 포착한 비율은 얼마인가요? | 91.67% | 1초 구간 코골이 이벤트 민감도(재현율), 5개 시드 평균. |
| 감지기가 코골이 구간을 표시했을 때 얼마나 자주 맞았나요? | 89.01% | 1초 구간 코골이 이벤트 정밀도, 5개 시드 평균. |
| 압축된 호흡 모델은 라벨이 지정된 구간을 얼마나 자주 정확히 분류했나요? | 88.49% | 200초 구간에서 정상과 무호흡 또는 저호흡을 분류한 프로덕션 벤치마크 정확도. |
| 호흡 구간 성능은 클래스 간에 얼마나 균형을 이루었나요? | 88.06% | 동일한 압축 프로덕션 벤치마크의 F1. Paper E는 프로덕션 민감도와 정밀도 쌍을 공개하지 않으므로 이를 추론하지 않습니다. |
연구 코퍼스에는 40명 참여자의 80개 짝지은 PSG 야간 기록(실험실 내 10 + 비강 기류 캐뉼라를 사용한 이동형 PSG 70)이 포함됩니다. 보고한 각 지표에 어떤 하위 집합, 라벨, 평가 절차가 적용되는지는 링크된 프리프린트에서 확인하세요.
마지막 부분, 즉 ‘우리가 무엇이라고 했는지 몰랐다’는 것이 ‘맹검 채점’의 의미입니다. 채점자를 우리 답으로 미리 훈련하지 않습니다. 그렇게 하면 시험이 순환 논리에 빠지기 때문입니다.
테스트 방법(쉬운 방법 설명)
감지 성능은 실험실과 이동형 또는 가정 환경에서 수집한 야간 PSG 참조 기록을 기준으로 측정했으며, 인증된 수면 기사가 오디오에 주석을 달았습니다. 기사가 채점한 모든 오디오 구간은 SomniSense 출력을 알 수 없도록 눈가림 처리되었습니다. 이러한 분리가 평가의 독립성을 유지합니다.
구체적으로:
- 표본: 짝지은 야간 기록 80개 / 참여자 40명(스마트폰 + PSG 동시 기록) — 실험실 PSG 10개 + 비강 기류 캐뉼라를 사용한 이동형 PSG 70개. 수면 호흡 문제를 진단받은 성인과 그렇지 않은 성인을 포함합니다. 집계 수치 뒤에 숨기지 않고 대표성이 부족한 집단(주로 18세 미만, 매우 극단적인 BMI, 일부 민족 집단)을 공개합니다. 맥락 없는 전체 표본 수는 오해를 부를 수 있으므로 코호트에 포함되지 않은 사람을 구체적으로 밝히고자 합니다.
- 녹음 매체: 침대 옆 스마트폰(2018년 이후의 다양한 iPhone 및 Android 모델), 참여자의 머리에서 50–90 cm 거리.
- 정답 기준: 동기화된 오디오 채널을 갖춘 PSG. AASM 교육을 받은 수면 기사가 SomniSense 출력을 모르는 상태로 수동 채점.
- 공개된 비교: 과업별 코골이 구간 및 호흡 구간 분류 지표. 프로덕션 이벤트 경계와 야간 지수에는 각각 별도의 평가가 필요하며 이러한 결과를 암묵적으로 물려받지 않습니다.
호흡 이벤트 감지 알고리즘은 창립자의 오랜 수면 무호흡 연구를 기반으로 합니다. SomniSense에 사용되는 버전은 스마트폰 오디오에 맞게 SomniAI LLC를 위해 처음부터 다시 학습하고 재구축했습니다. 임상 하드웨어와는 마이크, 거리, 음향 맥락이 다릅니다. 세 편의 연계 프리프린트가 방법 전체를 기록합니다. 계단식 기준선 프리프린트(다중 시드 bootstrap), Coordinate-Attention 1D 아키텍처 프리프린트(매개변수 93.2% 감소), 온디바이스 압축 프리프린트(Apple Neural Engine에서 0.064 ms 추론)입니다. 모두 인용 가능한 DOI와 함께 Zenodo에 공개되어 있습니다(cs.LG, eess.AS). 2단계 시스템의 결합 방식과 전체 프리프린트 포트폴리오는 연구 프로그램을 확인하세요. 아키텍처 상세 내용, SDK, 하드웨어 및 임상 파트너용 라이선스를 다루는 전체 기술 허브는 apneasense.com/research에 있습니다.
한계를 솔직하게 공개
아직 모르는 것과 제가 사용자라면 알고 싶은 것은 다음과 같습니다.
- 이 코호트는 모든 사람을 대표하지 않습니다. 개인이나 대표성이 부족한 집단의 성능은 다를 수 있으며, 공개된 집계 결과가 특정 개인에게 보수적인 수치라고 가정하지 않습니다.
- 음향 환경이 중요합니다. 단단한 표면, 본인보다 더 큰 파트너의 코골이, 휴대전화로 직접 부는 선풍기처럼 침실의 음향 특성이 특이하면 모델이 사용자의 이벤트를 더 적게 포착할 수 있습니다. 방법론 논문에 테스트 조건이 기록되어 있습니다.
- 프로덕션 출력에는 출력별 검증이 필요합니다. 구간 벤치마크만으로 앱에 표시되는 모든 이벤트 경계, 지속 시간, 라벨, BRI 값 또는 추세의 정확도를 확립할 수는 없습니다.
- 18세 미만에서는 검증되지 않았습니다. 코호트는 성인만 포함했습니다.
- 프리프린트이며 아직 동료 심사 전입니다. 세 편의 연계 프리프린트가 인용 가능한 DOI와 함께 Zenodo에 공개되어 있습니다. 동료 심사 학술지 출판은 별도 절차이며 완료되면 이 페이지에 표시합니다.
해당하지 않는 것
- 진단 주장이 아닙니다. 이러한 수치에도 불구하고 SomniSense는 의료 기기가 아니며 폐쇄성 수면 무호흡(OSA)을 진단하지 않습니다. OSA 진단에는 수면다원검사, 증상 평가와 수면 전문의의 판단이 필요합니다. SomniSense는 18세 미만 사용자에게 검증되지 않았습니다.
- 개인에 대한 보장이 아닙니다. 사용자의 구체적인 결과는 집단 평균과 다를 수 있습니다. 방법론 논문을 읽고 본인의 상황이 분포 안팎 어디에 해당하는지 확인하세요.
- 수면 검사를 대신하지 않습니다. 임상 AHI 기준을 BRI에 적용하지 마세요. 앱 수치와 관계없이 증상이나 우려가 있다면 전문적인 평가를 받아야 합니다.
이 문제가 맞는지 모르겠다면 증상부터 시작하세요
앱을 신뢰하기 전에 근거를 확인하러 왔다면 또 다른 출발점은 실제로 느끼는 증상입니다. 각 페이지에서 증상 뒤의 호흡 패턴과 대응 방법을 설명합니다.
이 정도 근거가 충분하다면
Free는 첫날 밤의 핵심 후보 근거, 매일 밤 5회 오디오 재생, 최근 7일 추세를 제공합니다. Pro가 더하는 것은 연속성이며 첫날 밤을 살펴볼 기본 권리를 제한하지 않습니다. 구매 정보는 요금 페이지에서 확인하세요.
Free로 시작하기 각 벤치마크와 그 경계 검토 →