Journal Search Engine

View PDF Download PDF Export Citation Korean Bibliography PMC Previewer
The Journal of The Korea Institute of Intelligent Transport Systems Vol.25 No.4 pp.221-236
DOI : https://doi.org/10.12815/kits.2026.25.4.221

A Study on the Reliability of Disengagement Rates as a Safety Metric for Autonomous Driving: Comparability across Operators and Robustness of Learning Trends

Seokjae Hong*, Seokjoong Kang**
*Graduate School of Management of Technology, Korea University
**Graduate School of Management of Technology, Korea University
Corresponding author : Seokjoong Kang, sjkang64@korea.ac.kr
26 July 2026 │ 10 August 2026 │ 18 August 2026

Abstract


The autonomous-vehicle disengagement reports of the California DMV have long served as a de facto measure of driving safety, and the decline in disengagements with cumulative mileage has often been read as a learning effect. As concerns grew that disengagements reflect the testing conditions and reporting practices of each operator rather than safety itself, the DMV moved in 2026 to retire these reports in favor of a new system-failure reporting scheme. This study asked two questions using a multi-year, operator-level panel from California: whether the observed decline is a robust learning signal once a few dominant operators and common time trends are properly accounted for, and whether narrowing the metric to system-initiated events genuinely makes it more reliable. The apparent learning trend lost significance under appropriate inference, is driven by a single operator, and even reverses in direction across operators. Narrowing the metric offers no improvement because the system-initiated series is governed by the entry of a new operator and by non-standardized reporting rather than by technology. These results suggest that the credibility of a safety metric depends less on what is counted than on how consistently it is reported and verified. Hence, redefining the metric is meaningful only on top of a standardized reporting system.



자율주행 해제율의 안전 지표 신뢰성 검정 연구: 운영자 간 비교가능성과 학습추세의 견고성을 중심으로

홍석재*, 강석중**
*고려대학교 기술경영전문대학원 박사과정
**고려대학교 기술경영전문대학원 교수

초록


캘리포니아 차량관리국(DMV)의 자율주행 해제(disengagement) 보고서는 자율주행 안전을 가늠하는 사실상의 지표로 활용되어 왔고, 누적 주행거리가 늘수록 해제가 줄어드는 현상은 흔히 학습효과로 해석되었다. 그러나 해제가 운영자의 시험 환경과 보고 관행에 좌우되어 비교가 어렵다는 문제가 누적되면서, DMV는 2026년 이 보고를 폐지하고 시스템 실패 중심의 새 보고체계로 전환하기로 했다. 본 연구는 캘리포니아의 다년간 운영자별 패널 자료로 두 가지를 검정한다. 첫째, 해제율의 감소가 소수의 운영자와 시간 효과를 적절히 통제한 뒤에도 유지되는 견고한 학습 신호인지, 둘째, 사건을 시스템 개시로 좁히는 전환이 지표의 신뢰성을 실제로 높이는지이다. 분석 결과 표면적 학습 추세는 적절한 통계적 추론에서 유의성을 잃고 특정 운영자에 의해 좌우되었으며, 운영자별 추세의 방향조차 엇갈렸다. 사건을 시스템 개시로 좁혀도 그 집계가 소수 운영자의 진입과 표준화되지 않은 기재에 좌우되어 개선이 나타나지 않았다. 이는 안전 지표의 신뢰성이 무엇을 세는가보다 어떻게 표준화해 보고·검증하는가에 달려 있으며, 지표의 재정의는 보고 체계의 정비 위에서만 의미를 가짐을 시사한다.



    Ⅰ. 서 론

    자율주행이 실도로 운영 단계에 진입하면서 그 안전성을 어떻게 측정할 것인가가 핵심 과제로 떠올랐다. 측정 지표의 선택은 단순한 기술적 문제가 아니라, 어떤 운영자가 더 안전한지, 기술이 실제로 성숙하고 있는지, 나아가 규제가 무엇을 근거로 판단할지를 좌우하는 제도적 선택이다. 그러나 자율주행의 안전성을 직접 측정하는 표준화된 지표는 아직 정립되지 않았고, 사고·상해와 같은 결과 지표는 노출 대비 발생이 극히 드물어 통계적 추론이 어렵다. 이 공백에서 캘리포니아 차량관리국(DMV)이 2014년부터 의무화한 해제(disengagement) 보고서는 자율주행 시스템이 인간 운전자에게 제어권을 넘긴 사건과 그 시점의 주행거리를 담은 가장 크고 오래 축적된 공개 자료다. 다년간 다수 운영자의 노출과 사건을 일관된 양식으로 수집한 종단 자료로는 거의 유일하기에, 해제 보고서는 학계와 산업계에서 자율주행 안전을 가늠하는 사실상의 지표로 활용되어 왔다.

    특히 “누적 주행거리가 늘수록 주행거리당 해제가 감소한다”는 관찰은 흔히 학습곡선, 곧 기술 성숙과 운영자 신뢰성 향상의 신호로 해석되었다(Dixit et al., 2016;Favarò et al., 2018;Banerjee et al., 2018;Kohanpour et al., 2025;Skokan and Mareček, 2025). 이러한 해석은 직관적이지만, 해제율의 하락이 곧 자율주행 기술의 학습을 의미한다는 인과적 주장은 운영자 간 이질성, 시간에 따른 산업 공통의 변화, 시험 구성과 보고 관행의 변화 등 여러 대안적 설명과 분리되어 검정된 바가 없다.

    한편 해제 지표의 타당성에 대한 비판도 누적되었다. 해제는 운영자의 위험 성향·시험 환경·보고 기준에 의존하며, 쉬운 경로만 시험하면 기록을 낮출 수 있어 “조작 가능(gameable)”하다는 지적이 제기되었다(Blumenthal et al., 2020;Vogt, 2020). 이러한 비판은 규제 변화로 이어져, DMV는 2026년 4월 채택한 새 규정으로 해제 보고 의무를 폐지하고 동적주행작업(Dynamic Driving Task, DDT; SAE International, 2021)에 대한 시스템 실패 보고로 대체하면서(California DMV, 2026b), 해제 자료가 “기업 간 비교 분석을 위해 설계되지 않았다”고 명시했다(California DMV, 2026a). 즉 본 연구의 대상 지표는 그 효용이 의심받으며 제도적으로 퇴장하는 시점에 있다.

    이 국면에서 두 가지 핵심 주장이 엄밀히 검정되지 않은 채 남아 있다. 첫째, 지표의 한계가 질적·규제적으로는 합의되었으나, 그 중심에 있는 “학습효과”가 통계적으로 견고한지는 검정된 바 없다. 둘째, 해제를 대체하는 시스템 실패 보고가 실제로 더 비교가능하고 견고한 지표를 산출할지도 평가된 바 없다. 본 연구는 35개 운영자·60개월의 운영자-월 패널에 운영자 고정효과 카운트 모형과 소수클러스터 강건추론(와일드 군집 부트스트랩)·이질성 검정을 결합하여 두 질문에 답한다: ① 누적 주행에 따른 해제율 감소는 통계적으로 신뢰할 수 있는 결과인가? ② 해제를 시스템 개시 사건으로 한정한다면 지표의 비교가능성과 통계분석 결과의 신뢰성이 높아지는가? 이로써 본 연구는 합의된 해제 지표의 한계를 엄밀한 통계적 추론으로 검정하고, 폐지가 확정된 지표를 대체하는 규제 전환의 효과를 새 보고체계의 시행에 앞서 기존 자료로 검토한다. 다만 본 연구는 해제율과 실제 안전 결과(사고·충돌·상해)의 관계를 직접 검증하지 않는다. 따라서 본 연구가 다루는 것은 해제율의 안전 지표로서의 적합성이 아니라, 운영자 간 비교 및 기술 성숙도 평가 지표로서의 한계이다.

    본 논문의 구성은 다음과 같다. 제Ⅱ장에서 해제 데이터 기반 학습·성숙도 연구, 지표 타당성 비판과 보고체계 전환, 희소사건 카운트 자료의 추론을 검토하고 본 연구의 차별성을 밝힌다. 제Ⅲ장에서 자료·패널과 모형, 소수클러스터 강건추론, 보고체계 전환의 평가 설계를 제시한다. 제Ⅳ장에서 기준 학습효과, 추론의 취약성, 운영자 간 이질성과 비교불가능성, 보고체계 전환의 사전 검토를 차례로 제시하고, 제Ⅴ장에서 결과를 해석하여 정책·방법론적 함의와 한계를 논의하며, 제Ⅵ장에서 결론을 맺는다.

    Ⅱ. 관련 연구

    1. 해제 데이터 기반 학습·성숙도 연구

    캘리포니아 해제보고서는 전 세계에서 가장 광범위하게 분석된 자율주행 실도로 데이터다. 초기 연구는 해제의 빈도·원인과 사고·주행거리의 관계를 기술적으로 규명했다. Dixit et al.(2016)은 해제·사고와 누적주행의 상관을, Favarò et al.(2017)은 사고 보고서를, Favarò et al.(2018)은 해제의 추세·유발요인을 분석했으며, Banerjee et al.(2018)은 100만 마일이 넘는 데이터에서 주행거리당 해제의 감소 경향을 보고했다. 이후 다수 연구가 이 감소를 기술 성숙·학습의 신호로 해석했다(Kohanpour et al., 2025;Skokan and Mareček, 2025). 후자는 보고 관행의 비일관성이 직접 비교를 제약한다는 한계도 함께 지적했다. 국내에서도 해제 원인을 운전자·차량·환경으로 분류한 분석이 이루어졌다(Yun et al., 2018). 또한 국내 ITS 분야에서는 시뮬레이션상 자율차 거동의 적정성을 평가하는 방법론(Jo et al., 2022), 실도로 자율차 데이터로부터 주행안정성 등 안전 평가지표를 도출하는 연구(Lee et al., 2024), 자동차전용도로 자율주행 실증에서 제어권 전환(시스템 개입) 상황을 분석한 연구(Hyun et al., 2024), 그리고 양산 자율주행차를 직접 운행하며 도로 시설물 구간에서 자율주행 기능이 해제되는 상황을 분석한 연구(Park et al., 2024)가 보고되었다.

    그러나 이들은 대체로 추세선·상관계수 또는 지표의 기술(記述)·도출에 기반해, 과대산포·운영자 이질성·소수클러스터 추론과 같은 통계적 쟁점을 정면으로 다루지 않았고, “학습효과”의 견고성이나 보고된 해제 지표 자체의 운영자 간 비교가능성을 추론적으로 검정하지는 않았다. 그러나 관찰된 해제율 하락을 학습의 결과로 읽으려면 그 전에 세 가지를 걸러내야 한다. 첫째, 전체 추세가 사실은 한 운영자의 자료로 만들어진 것은 아닌가? 둘째, 모든 운영자에게 같은 시기에 함께 작용한 변화를 개별 운영자의 학습으로 잘못 읽은 것은 아닌가? 셋째, 운영자마다 감소 속도가 달라 하나의 평균으로 묶는 것 자체가 성립하지 않는 것은 아닌가? 이 셋을 나누어 검정한 연구는 사실상 부재하다.

    2. 해제 지표의 타당성 비판과 보고체계 전환

    해제를 안전의 비교지표로 사용하는 데 대한 비판도 축적되었다. RAND 보고서(Blumenthal et al., 2020)는 해제가 환경·위험성향·기업 정책·보고 기준에 깊이 의존해 안전을 직접 반영하지 못한다고 지적했고, 산업계에서도 해제가 운영 선택에 따라 임의로 조정될 수 있다는 비판이 제기되었다(Vogt, 2020). 운영자는 시험 노선·시간대·기상 조건을 선택할 수 있고, 무엇을 “해제”로 기록할지에 대한 내부 기준도 상이하므로, 동일한 명칭의 사건이 운영자마다 전혀 다른 모집단에서 수집된다. 이러한 흐름은 규제 변화로 이어져, DMV는 해제 보고를 폐지하고 시스템 실패 보고로 전환했다(California DMV, 2026b, p.25). 그러나 “시스템이 일으킨 실패만 세면 더 비교가능하고 의미 있는 신호가 된다”는 전환의 전제가 데이터에서 성립하는지는 검증된 바 없다.

    보다 근본적으로, 해제는 안전이라는 구성개념(construct)을 직접 측정하지 못하는 대리지표다. 해제는 자율주행 시스템이 인간에게 제어를 넘긴 사건일 뿐 충돌·상해와 직접 연결되지 않으며, 보수적으로 설계된 시스템일수록 안전을 위해 더 자주 제어를 넘길 수 있어 잦은 해제가 반드시 낮은 안전을 뜻하지는 않는다. 즉 해제는 검증된 안전의 선행지표가 아니며, 그 타당성은 운영자 간 보고 기준과 운영 맥락이 표준화될 때에만 부분적으로 확보된다. 이러한 구성타당도의 한계는 지표를 해제로 정의하든 시스템 실패로 정의하든, 측정의 표준화 없이는 해소되지 않는다.

    3. 희소사건 카운트 자료의 통계적 추론

    해제는 주행거리당 발생하는 희소 계수(count) 사건이므로, 노출(주행거리)을 offset으로 둔 포아송·음이항 회귀가 자연스럽다(Hausman et al., 1984;Cameron and Trivedi, 2013). 그러나 운영자별 패널에서는 군집(운영자) 내 상관과 과대산포가 추론을 왜곡하며, 운영자 단위로 묶어 오차의 상관을 허용하는 표준오차는 운영자 수가 충분할 때만 타당하며(Cameron and Miller, 2015), 수가 적으면 표준오차가 실제보다 작게 추정되어 유의하지 않은 결과를 유의하다고 판정하게 된다. 이를 보정하기 위한 와일드 군집 부트스트랩이 제안·정립되었으며, 특히 군집 수가 작을 때 신뢰할 수 있는 추론을 제공한다(Cameron et al., 2008;MacKinnon and Webb, 2017;MacKinnon and Webb, 2018;Roodman et al., 2019). 한편 해제 자료를 보다 엄밀히 다룬 연구들도 신뢰성 추정(Min et al., 2022)과 데이터의 정제·구축(Sinha et al., 2021)에 초점을 두었을 뿐, 학습효과의 견고성이나 운영자 간 비교가능성을 추론적으로 검정하지는 않았다.

    4. 본 연구의 차별성

    본 연구는 운영자 고정효과 카운트 모형에 소수클러스터 강건추론과 이질성 검정을 결합하여 학습효과의 견고성을 재검정하고, 나아가 시스템 개시로의 보고체계 전환이 비교가능성과 추론 견고성을 실제로 개선하는지를 동일 자료로 평가한다. 이는 추세선·상관에 머문 기존 분석이 다루지 못한 과대산포·소수클러스터·운영자 이질성을 정면으로 다룬다는 점, 그리고 폐지가 확정된 지표의 대체안을 새 보고체계의 시행에 앞서 기존 자료로 사전 검토한다는 점에서 선행연구와 구별된다. 본 연구의 결론은 특정 운영자에 대한 평가가 아니라, 운영자를 가로질러 통합한 해제 지표가 안전 지표로서 갖는 구조적 한계에 관한 것이다.

    Ⅲ. 자료 및 방법

    1. 자료 및 패널 구축

    캘리포니아 DMV의 두 원시 자료—운영자별 월 자율주행 주행거리(Mileage)와 해제보고서(Disengagement Report)—를 사용한다. 분석 기간은 2020년 12월부터 2025년 11월까지의 60개월이고, 본 연구 수행 시점에 공표된 자료는 2025년 11월까지의 보고서이다. 2020년 12월 이후만 사용한 것은 그 이전 보고서가 운영자별 개별 파일로 공개되어, 같은 양식을 쓰면서도 보고 대상 기간이 운영자마다 14개월에서 21개월까지 다르거나 아예 적히지 않은 사례가 섞여 있기 때문이다. 이 시기의 월별 주행거리는 어느 해의 몇 월인지 자료만으로 확정할 수 없어 월 단위로 정렬되지 않는다. 2020년 12월분부터는 전 운영자의 자료가 하나의 파일로 통합되고 각 월에 연도가 표시되어 월 단위 패널을 구성할 수 있다. 이 선택이 웨이모 등 조기 진입 운영자의 초기 학습 구간을 절단할 수 있다는 점은 Ⅴ.4의 한계에서 논의한다. 두 자료 모두 안전운전자가 동승한 유인 시험 보고분이며, 별도로 공표되는 무인(driverless) 보고 파일과 최초 보고자(first-time filer) 별도 파일은 표본에서 제외한다. 해제보고서를 운영자·월 단위로 집계하되, 동일 운영자-월이 복수 연도 파일에 중복 보고된 경우 보고 건수의 최댓값을 취했다(중복 키 3건, 집계 차이 0.04%). 운영자는 허가번호(permit number)를 기준으로 연결하며, 연도 파일 간 법인명 변경(예: AVT021 AutoX Technologies는 2025년 파일에 Tensor Auto Inc.로 기재)은 동일 운영자로 처리한다. 이렇게 구축한 패널은 35개 운영자×최대 60개월, 총 1,041 운영자-월 관측치로 구성된다(<Table 1>). 분석 기간 내 해제가 전무한 1개 운영자는 고정효과 카운트 모형 추정에서 제외되므로, 전체 표본의 유효 군집 수는 34다. 주행거리가 압도적으로 큰 상위 10개 운영자(이하 Top10)가 전체 주행거리의 약 98%를 차지하므로, 소수 대형 운영자에 의한 결과 좌우 가능성을 점검하기 위해 전체 표본(All)과 Top10을 병행 분석한다. 분석 변수는 월 자율주행 주행거리(노출), 월 해제 건수(결과), 운영자별 누적 자율주행 주행거리의 로그(경험량, log_cum)이며, 해제보고서의 “DISENGAGEMENT INITIATED BY” 필드를 이용해 각 해제를 시스템 개시(AV System — 해제보고서의 개시 주체 필드에서 자율주행시스템이 스스로 해제를 개시했음을 뜻하는 기재값)·기타 기재·미상으로 분류하고 시스템 개시 부분집합을 별도로 구성했다(3.4절). 개시 주체는 대소문자를 정규화한 값이 AV System으로 시작하는 경우를 시스템 개시로(세부 유형이 병기된 변형 기재 포함), 그 밖의 기재를 기타 기재로, 무기재를 미상으로 분류하며, 이하 알려진 해제는 개시 주체가 기재된 해제를 뜻한다.

    <Table 1>

    Panel descriptive statistics and annual totals

    (a) Panel descriptive statistics
    Item All Top 10
    No. of operators 35 10
    Observations (operator-month) 1,041 513
    Months / period 60 (2020-12–2025-11) 60 (2020-12–2025-11)
    Total mileage (mi) 23,734,437 23,300,593
    Total disengagements 28,499 12,194
    Monthly mileage, mean / median 22,800 / 1,564 45,420 / 6,654
    Monthly diseng., mean / median / max 27.4 / 1 / 1,507 23.8 / 1 / 1,476
    Share of months with zero diseng. 39.1% 46.0%
    Operator rate (/1k mi), median 2.884 0.071
    Operator rate, min – max 0.0000 – 1330.2 0.0133 – 13.6
    (b) Annual mileage, disengagements, and rate
    Year Mileage (mi) Diseng. Rate (/1k mi)
    2021 4,091,105 2,660 0.65
    2022 5,099,146 8,213 1.61
    2023 5,748,300 6,562 1.14
    2024 3,912,658 1,772 0.45
    2025 4,883,228 9,292 1.90

    <Table 1>이 보이듯 자료는 두 가지 통계적 특징을 갖는다. 첫째, 해제는 희소 사건으로 전체 관측치의 39.1%(Top10은 46.0%)에서 0건이며 분포가 강하게 우측으로 치우쳐 있다. 둘째, 해제가 있는 34개 운영자의 해제율은 최소 0.0133에서 최대 1,330(/1,000마일)까지 약 10만 배, 약 5자릿수에 걸쳐 분포한다. 또한 연도별 전체 해제율(/1,000마일)은 0.65(2021)→1.61(2022)→1.14(2023)→0.45(2024)→1.90(2025)으로 단조적 추세를 보이지 않는다(<Table 1>(b)). 이러한 0의 과다, 강한 우측 치우침, 운영자 간 자릿수 규모의 격차는 이후 추론에서 과대산포와 소수클러스터 문제를 다루어야 함을 예고한다.

    2. 모형

    월 주행거리를 노출 offset으로 둔 포아송 고정효과 모형을 기준으로 한다: log E [ y i t ] = log ( miles i t ) + β · log ( cum_miles i t ) + α i . 여기서 y i t 는 해제 건수, α i 는 운영자별 시간불변 이질성(보고 관행·차종·운영설계영역(ODD) 등)을 흡수하는 고정효과, β 는 누적 경험량(log_cum)에 대한 탄력성이다. 고정효과를 둠으로써 β 는 운영자 간 차이가 아니라 동일 운영자 내부의 누적주행에 따른 변화로 식별된다. 고정효과는 운영자 더미를 포함한 최우추정으로 구현하며, 포아송에서는 이것이 조건부 최우추정과 일치하여 부수적 모수 문제를 일으키지 않는다(Cameron and Trivedi, 2013). β < 0 이면 누적주행이 2배가 될 때 해제율이 ( 2 β 1 ) × 100 % 만큼 변하며, 이를 학습효과로 해석해 왔다. 강건성 점검을 위해 과대산포를 허용하는 음이항(NB2)과 누적량 1기 시차(lag) 사양도 함께 추정한다. 다만 음이항에 고정효과를 결합하는 추정에는 알려진 한계가 있으므로(Allison and Waterman, 2002), NB2 결과는 참고용 강건성 점검으로 해석한다.

    3. 추론: 과대산포와 소수클러스터

    포아송 모형은 분산이 평균과 같다고 가정하는데, 이 자료에서는 실제 분산이 그 가정의 약 22~23배에 이른다(피어슨 χ 2 / 자유도 ). 이처럼 분산이 가정보다 훨씬 큰 현상을 과대산포라 하며, 이 경우 포아송 표준오차에 근거한 p값은 신뢰할 수 없다. 또한 운영자 수가 적어, 운영자 단위로 묶어 오차의 상관을 허용하는 표준오차(CR1)가 실제보다 작게 추정된다. 따라서 핵심 계수 β 를 네 방법으로 교차 검정한다: ① CR1 표준오차와 정규 근사(관행적 기준선), ② 잭나이프(CR3)와 t ( G 1 ) 분포, ③ 클러스터 단위 쌍(pairs) 부트스트랩, ④ 와일드 군집 부트스트랩-t(WCB-t). 네 방법은 군집 내 상관과 소수클러스터 편의에 대한 보정 강도가 서로 달라, 동일한 점 추정치가 추론 방법에 얼마나 민감한지를 삼각검증할 수 있게 한다. WCB-t는 클러스터 수 G 가 작을 때 2 G 개 가중을 완전 열거해 정확한 p값을 산출하며(Top10은 2 10 = 1,024 개 전수), 소수클러스터 상황에서 가장 신뢰할 수 있는 추론으로 평가된다. 본 연구의 WCB-t는 비선형 최우추정에 부합하도록 귀무가설( β = 0 )을 부과한 제약 추정치의 군집별 스코어에 라데마허(±1) 가중을 곱해 검정통계량의 분포를 재구성하는 스코어 부트스트랩 계열로 구현하며, 전체 표본( G = 34 )에는 완전 열거 대신 무작위 가중 재추출( B = 9,999 )을 적용한다(Roodman et al., 2019). 아울러 관측치가 매우 적은 운영자에 대해서는 가중치 선택의 영향을 확인하기 위해 Webb 6점 가중을 전수 열거하고, 재추출한 표본마다 검정통계량을 각각 표준화하는 방식을 함께 적용한다. 운영자 간 기울기 동질성은 공통기울기 우도비(likelihood ratio, LR) 검정으로, 집계 추정치의 단일운영자 의존도는 운영자 단위 leave-one-out 레버리지로 진단한다.

    과대산포는 단순한 통계적 잔여가 아니라 자료 생성과정의 특징을 반영한다. 전체 관측치의 39~46%가 0건이고 일부 월에는 1,500건에 가까운 해제가 보고되는 강한 우측 치우침은, 운영자·시기에 따라 보고 단위와 기준이 다름을 시사한다. 이러한 분포에서 포아송 가정에 근거한 표준오차는 분산을 과소추정하여 유의성을 과대평가하므로, 본 연구는 과대산포를 허용하는 사양과 소수클러스터 강건추론을 함께 사용해 점 추정치의 부호·크기뿐 아니라 그 유의성의 견고성까지 평가한다.

    4. 보고체계 전환의 평가 설계

    2026년 규정은 원시 해제 대신 시스템이 일으킨 실패를 보고하도록 한다. 새 규정의 보고 대상은 시스템 실패 외에 차량 고착(immobilization)·급제동·주행거리(VMT) 등을 포함하나, 본 연구는 기존 해제 자료로 근사할 수 있는 시스템 실패 보고 축에 초점을 둔다. 그 근사치로 AV System 개시 해제 부분집합을 구성하고, 총 해제와 네 축에서 비교한다: ① “DISENGAGEMENT INITIATED BY” 필드 기재의 일관성과 시스템 시계열의 구성 가능성, ② 운영자 간 해제율 격차(분포 폭), ③ β ·WCB-t에 의한 학습추세 견고성, ④ 공통기울기 LR·레버리지에 의한 이질성. 총 해제에서 도출한 결론이 시스템 부분집합에서도 유지되는지로 지표 협소화의 효과를 직접 검증한다. 이 설계는 “무엇을 세는가(사건 정의)”를 바꾸는 것만으로 비교가능하고 견고한 지표가 얻어지는지를 동일 자료에서 직접 확인하기 위한 것이다.

    Ⅳ. 분석 결과

    1. 기준 학습효과

    <Table 2>는 동일한 학습효과 추정에 대해 표본·사양과 추론 방법을 달리할 때 유의성이 어떻게 달라지는지를 정리한 것이다.

    <Table 2>

    Learning-effect estimates and significance by inference method

    Sample / spec. Inference β (log_cum) Effect per 2× p-value
    All CR1 (normal) −0.359 −22.0% 0.026
    All Jackknife CR3 −0.359 −22.0% 0.334
    All Pairs bootstrap −0.359 −22.0% 0.384
    All WCB-t −0.359 −22.0% 0.515
    Top 10 CR1 (normal) −0.532 −30.8% ≈0
    Top 10 Jackknife CR3 −0.532 −30.8% 0.042
    Top 10 Pairs bootstrap −0.532 −30.8% 0.066
    Top 10 WCB-t (210 exact) −0.532 −30.8% 0.143
    All, excl. Apple CR1 (normal) +0.006 +0.4% 0.957
    All + year FE CR1 (normal) −0.186 −12.1% 0.051
    All + year FE WCB-t −0.186 −12.1% 0.111

    기준 포아송 고정효과 모형에서 log_cum 계수는 전체 표본 β = 0.359 (발생률비(incidence rate ratio, IRR) 0.699), Top10 β = 0.532 (IRR 0.588)로 모두 음(−)이다(<Table 2>). 이는 누적 주행거리가 2배가 될 때 해제율이 각각 약 22.0%, 30.8% 감소함을 뜻하며, 표면적으로는 “학습효과”와 부합한다. 1기 시차 사양에서는 점 추정치의 부호와 대략적 크기가 유지되나( β = 0.33 ), 음이항에서는 부호는 유지되되 크기가 절반 수준으로 축소된다( β = 0.19 ). 이 결과만 보면 기존 문헌의 성숙·학습 해석을 지지하는 것처럼 보인다.

    2. 추론의 취약성

    그러나 이 결론은 추론 방법에 따라 무너진다(<Table 2>). 동일한 점 추정치라도, CR1(정규)에서는 전체·Top10 모두 강하게 유의하지만, 클러스터를 하나씩 제외하는 잭나이프(CR3)에서 표준오차가 전체 0.161→0.366, Top10 0.035→0.225로 크게 부풀어 오른다(Top10에서는 약 6배). 쌍 부트스트랩과 WCB-t에서는 유의성이 사라지며, 가장 신뢰할 수 있는 WCB-t의 p값은 전체 0.515, Top10 0.143으로 모두 비유의다. 나아가 Apple 한 운영자를 제외하면 계수가 +0.006(p=0.957)으로 부호가 반전되고, 연도 고정효과를 더하면 −0.186으로 절반 축소되고, 이 사양에서도 WCB-t p값은 0.111로 비유의다. 표준오차가 잭나이프에서 크게 부풀어 오른다는 것은 추정치가 소수 클러스터에 크게 의존함을 뜻하며, 점 추정치의 부호가 단일 운영자 제외와 연도 통제에 따라 뒤집히거나 반감된다는 것은 그 음의 계수가 안정적 신호가 아님을 보여준다. 요컨대 “학습효과”는 적절한 추론하에서 통계적으로 견고하지 않다.

    3. 운영자 간 이질성

    <Fig. 1>은 상위 10개 운영자 각각에 대해 개별 추정한 학습 기울기를 나타낸 것으로, 0보다 낮은 막대는 누적 주행에 따라 해제율이 감소함을 뜻한다.

    KITS-25-4-221_F1.jpg
    <Fig. 1>

    Per-operator learning slopes βi (Top 10); bars below zero indicate a declining disengagement rate with cumulative mileage, above zero an increasing rate

    집계된 단일 기울기가 타당한 요약인지 점검하기 위해 운영자별 기울기를 추정하면, Top10 안에서도 부호가 갈린다(<Fig. 1>). Mercedes(−42%)·Apple(−32%)·Zoox(−27%)·Cruise(−27%)·Waymo(−19%)·Pony(−15%)는 음(−)이지만, WeRide(+37%)·Nuro(+69%)·AutoX(+210%)·DiDi(+276%)는 양(+)으로, 일부 운영자는 누적주행이 늘수록 해제율이 오히려 증가한다. 공통기울기 가정의 우도비 검정은 Top10에서 LR = 643.0 ( p = 1.2 × 10 132 ) , 전체에서 LR = 4,236.9 ( p 0 ) 로 강하게 기각된다. 즉 운영자를 가로지르는 단일 “학습 탄력성”은 통계적으로 타당한 요약이 아니다.

    <Table 3>은 전체 표본에서 운영자를 하나씩 제외할 때 학습 기울기 계수가 얼마나 변하는지를 변화량 상위 순으로 정리한 것이다.

    <Table 3>

    Operator leave-one-out leverage (top 6; full-sample β=−0.359)

    Excluded operator β when excluded Δ
    Apple +0.006 +0.365
    Beep −0.430 −0.072
    aiMotive −0.390 −0.032
    Nuro −0.368 −0.010
    Ghost Autonomy −0.367 −0.008
    Motional −0.366 −0.007

    운영자 leave-one-out 진단(<Table 3>)은 이를 재확인한다. 전체 표본 계수 −0.359는 Apple을 제외할 때 +0.006으로 변화량 +0.365를 보이는데, 이는 2위 운영자(Beep, −0.072)의 약 5배다. 해제를 매우 조밀하게 보고하면서 동시에 빠르게 그 빈도를 낮춘 Apple의 궤적이 전체 집계 기울기를 사실상 단독으로 만든 것이다.

    4. 운영자 간 비교 불가능성

    <Fig. 2>는 운영자별 해제율을 로그 척도로 나타낸 것이다.

    KITS-25-4-221_F2.jpg
    <Fig. 2>

    Per-operator disengagement rate (per 1,000 miles, log scale), spanning roughly five orders of magnitude

    <Table 4>는 주행거리 상위 10개 운영자의 주행거리·해제 건수·해제율·해제 1건당 주행거리(MPD)와 점유율을 나란히 놓아 운영자 간 보고 기준의 격차를 보인 것이다.

    <Table 4>

    Cross-operator comparability indicators (Top 10, by mileage)

    Operator Mileage (mi) Diseng. Rate (/1k) MPD (mi) Mileage share Diseng. share
    Waymo 14,632,034 1,092 0.075 13,399 61.6% 3.8%
    Zoox 3,582,102 100 0.028 35,821 15.1% 0.4%
    Cruise 2,330,848 31 0.013 75,189 9.8% 0.1%
    Apple 744,036 10,124 13.607 73 3.1% 35.5%
    Pony.AI 690,829 47 0.068 14,698 2.9% 0.2%
    Nuro 626,200 432 0.690 1,450 2.6% 1.5%
    WeRide 264,458 23 0.087 11,498 1.1% 0.1%
    Mercedes-Benz 224,713 338 1.504 665 0.9% 1.2%
    AutoX 122,359 3 0.025 40,786 0.5% 0.01%
    DiDi 83,014 4 0.048 20,753 0.3% 0.01%

    <Fig. 3>은 운영자별 주행거리 점유율과 해제 점유율을 대비한 것이다.

    KITS-25-4-221_F3.jpg
    <Fig. 3>

    Share of mileage vs. share of disengagements by operator; Apple reports a large disengagement share (35.5%) from a small mileage share (3.1%), Waymo the opposite

    운영자별 해제율은 최소 0.0133에서 최대 1,330(/1,000마일)까지 약 10만 배, 약 5자릿수(5 orders of magnitude)에 걸쳐 분포한다(<Fig. 2>). 이는 같은 “disengagement”라는 명칭이 운영자마다 전혀 다른 사건을 센다는 강력한 증거다(<Table 4>). 단적으로 Apple은 전체 주행거리의 3.1%만 차지하면서 전체 해제의 35.5%를 보고하며, 해제 1건당 주행거리(MPD)가 73마일에 불과하다. 반면 Waymo는 전체 주행거리의 61.6%를 차지하지만 해제는 3.8%만 보고하고 MPD는 13,399마일로 Apple의 약 183배다(<Fig. 3>). 운영자 간 보고 기준이 자릿수 단위로 다른 상황에서, 운영자를 통합한 평균 해제율이나 그 추세는 안전의 비교지표가 될 수 없다.

    5. 보고체계 전환의 사전 검토

    마지막으로, 2026년 규정이 도입하는 “시스템 실패” 보고가 위 문제들을 해소하는지를 평가한다. 첫째, 시스템 시계열을 구성할 토대 자체가 불안정하다(<Fig. 4>). 시스템 개시 해제 건수는 164건(2024)에서 4,249건(2025)으로 급증하고 알려진 해제 중 시스템 개시 비중도 9.3%에서 45.8%로 뛰지만, 이는 기술 변화가 아니라 표본 구성의 변화다. 2025년 시스템 개시 4,249건 중 4,237건(99.7%)이 그해 표본에 처음 진입한(3.1절) 운영자 1곳(Beep)에서 나왔고, 이 운영자를 제외하면 2025년의 시스템 개시 비중은 0.8%에 그친다. 아울러 개시 주체 필드의 값 체계도 표준화되어 있지 않아, 동일 범주의 대소문자·표기가 운영자마다 갈리고 세부 유형이 자유 기재로 혼재하여(예: Test Driver/Test driver, AV System - Emergency Stop, Software, ADS), 범주 정의가 운영자·연도 간 일관되지 않는다. 다만 급증이 Beep 1곳에 귀속된다는 판정은 분류 규칙의 선택에 좌우되지 않는다. 기재된 해제를 모두 시스템 개시로 간주하는 극단적 재분류를 상정하더라도, Beep을 제외한 운영자들의 알려진 해제 총량(1,420건)이 상한으로 작용하여 2025년 시스템 개시 중 Beep의 비중은 최소 74.9%로 유지된다. 즉 신규 진입과 기재 관행에 좌우되는 시계열로는 일관된 시스템 실패 지표를 구성할 수 없다.

    <Fig. 4>는 연도별 시스템 개시 해제 건수와, 개시 주체가 알려진 해제 가운데 시스템 개시가 차지하는 비중을 나타낸 것이다.

    KITS-25-4-221_F4.jpg
    <Fig. 4>

    Annual AV-system-initiated disengagements (bars; single 2025 entrant vs. others) and the AV-system share of known disengagements (line); the 2025 surge reflects one new entrant (Beep)

    둘째, 비교가능성은 개선되지 않는다(<Table 5>). 시스템 개시 해제율의 운영자 간 격차는 여전히 약 5자릿수(89,726배)이며, 35개 운영자 중 13개만 시스템 개시 해제를 보고한다(22개는 0건). 셋째, 학습추세의 견고성도 개선되지 않는다. 시스템 부분집합에서 WCB-t p값은 전체 0.558, Top10 0.250으로 여전히 비유의이며(Top10 시스템 표본은 G = 4 로 완전열거 가중 조합이 2 4 = 16 개에 그쳐 p값 해상도도 1/16 단위로 거칠고, 양측 p의 도달 하한도 2/16=0.125여서 5% 수준 기각이 구조적으로 불가능하다. Webb 6점 가중 전수(1,296조합)를 병행하면 p=0.134로 역시 비유의여서, 이 결론은 가중 선택이나 격자 해상도의 산물이 아니다), 사용 가능한 운영자가 4~13개로 줄어 검정력만 더 낮아진다. 넷째, 이질성과 단일운영자 의존도 지속된다. 시스템 기준에서도 공통기울기 LR은 기각되고(Top10 LR = 106.3 , p = 6.8 × 10 23 ), Apple의 레버리지(제외 시 변화 +0.370)도 그대로다. 아울러 이 판정은 분류 규칙의 선택에 강건하다: 정확 일치로 좁혀 변형 기재를 제외해도 격차·추정·검정은 사실상 동일하다( G = 12 , β = 0.269 , WCB-t p=0.561). 요컨대 가용 근사자료를 기준으로 할 때, 지표를 시스템 개시로 좁히는 것은 네 축 가운데 어느 하나도 개선하지 못한다.

    <Table 5>는 전체 해제와 시스템 개시 해제를 (a) 운영자 간 비교가능성과 (b) 학습추세의 견고성에서 대비한 것이다.

    <Table 5>

    Evaluation of the reporting transition: total vs. AV-system-initiated disengagements

    (a) Comparability
    Metric Operators (rate>0) Max Min Ratio log10(Ratio)
    Total 34 1,330.2 0.013 100,018 5.0
    AV-System 13 716.4 0.008 89,726 4.95
    (b) Robustness of the learning trend
    Sample Metric β Effect per 2× WCB-t p Overdisp. G
    All Total −0.359 −22.0% 0.515 23.5 34
    All AV-System −0.268 −16.9% 0.558 24.4 13
    Top 10 Total −0.532 −30.8% 0.143 22.6 10
    Top 10 AV-System −0.574 −32.8% 0.250 8.9 4

    Ⅴ. 논 의

    1. “학습효과”의 재해석

    본 연구의 첫 발견은 관찰되는 “누적주행↑ ⇒ 해제율↓”이 통계적으로 견고한 학습효과가 아니라는 것이다. 동일한 음(−)의 점 추정치가 (i) 적절한 소수클러스터 추론(WCB-t)에서 유의성을 잃고, (ii) 단일 운영자(Apple)를 제외하면 부호가 반전되며, (iii) 연도 고정효과를 더하면 절반으로 축소되었다. 이는 세 가지 교란이 “학습”으로 오인되어 왔음을 시사한다. 첫째, 전체 추세가 한 운영자에 의해 만들어졌다. Apple의 궤적이 전체 집계 기울기를 사실상 단독으로 형성했다(leave-one-out 변화 +0.365, 2위의 약 5배). 둘째, 같은 시기에 모든 운영자에게 함께 작용한 변화가 개별 학습과 섞였다. 연도 고정효과가 흡수하는 산업 공통의 변화(규제·도로환경·운영 정책 등)가 운영자별 학습과 분리되지 않은 채 추정에 섞였다. 다만 연도 고정효과는 산업 공통의 학습 자체도 함께 흡수하므로, 이 결과는 운영자 고유의 학습이 식별되지 않음을 뜻할 뿐 산업 수준의 학습까지 기각하는 것은 아니다. 셋째, 운영자마다 감소 속도가 달랐다. 운영자별 기울기가 −42%에서 +276%까지 분포하고 공통기울기 가정이 강하게 기각되므로, 운영자를 가로지르는 단일 “학습 탄력성” 자체가 존재하지 않는다.

    일부 운영자에서 누적주행과 함께 해제율이 오히려 증가하는 것은, 학습보다는 시험 범위의 확장(더 어려운 운영설계영역으로의 이동)이나 보고 기준의 변화로 설명되는 편이 자연스럽다. 통합 자료에서 관찰되는 하락은 개별 운영자의 기술 향상이라는 인과적 의미의 “학습”이 아니라, 표본 구성(어느 운영자가 언제 얼마나 주행했는가)과 보고 관행의 변화가 합쳐진 구성 효과일 수 있다. 누적주행과 함께 해제율이 낮아진다는 관찰만으로 학습을 주장하려면, 최소한 운영자별로 노출을 정규화하고 시간 공통 충격을 통제한 뒤 적절한 소수클러스터 추론하에서 그 음의 기울기가 유지됨을 보여야 한다. 본 자료에서는 그러한 조건에서 음의 기울기가 견고하게 유지되지 않는다. 따라서 해제 추세를 인과적 “학습”으로 읽는 것은 경계해야 하며, 관찰된 감소는 본 자료만으로는 보고 행태·시험 구성·표본 구성의 변화와 구분되지 않는다.

    2. 지표 전환이 문제를 해결하지 못하는 이유

    두 번째 발견은 더 실천적이다. 2026년 전환은 “운영자 개입(인간 개시)을 제거하고 시스템이 일으킨 사건만 세면 더 깨끗하고 비교가능한 신호가 된다”는 전제에 기반하나, 본 연구는 가용 자료에서 그 근사치를 구성해 이 전제가 성립하지 않음을 보였다. 핵심 원인은 병목이 “무엇을 세느냐”가 아니라 “어떻게 보고되느냐”에 있다는 점이다. 첫째, 시스템 실패를 식별하는 데 필요한 하위 필드(“DISENGAGEMENT INITIATED BY”)조차 연도·운영자 간 비일관하다. 값 체계가 표준화되어 있지 않고 시스템 개시 비중이 운영자 1곳의 진입만으로 9%에서 46%로 뛰는 상황에서는, 더 좁은 지표를 정의해도 그것을 일관되게 측정할 수 없다.

    둘째, 비교불가능성의 근원인 운영자 간 보고 기준·운영설계영역·시험 강도의 차이는 사건을 좁힌다고 사라지지 않는다. 시스템 개시 해제율 역시 약 5자릿수에 분포하며 35개 중 13개 운영자만 해당 사건을 보고한다. 더욱이 어느 운영자가 언제 보고를 시작·중단하는가가 집계를 좌우하므로, 신규 진입 1곳이 시스템 개시 집계의 대부분을 차지하는 해가 생긴다. 새로 정의된 지표라 하더라도 동일한 보고 이질성과 표본 구성 구조를 그대로 물려받는 한, 운영자 간 비교지표로서의 타당성은 확보되지 않는다. 요컨대 지표의 협소화는 측정 대상을 바꿀 뿐, 측정의 표준화·완전성을 보장하지 못한다. 비교가능하고 견고한 안전 지표의 전제조건은 사건 정의가 아니라 (i) 표준화된 필드와 데이터 사전, (ii) 결측·비일관의 통제, (iii) 운영설계영역·노출에 대한 정규화다. 설령 새 규정이 보고 필드와 값 체계를 표준화하더라도, 운영자 간 약 5자릿수의 해제율 격차와 소수클러스터에 따른 추론의 취약성은 그대로 남으므로, 전환의 한계는 자료 품질의 문제로 환원되지 않는다.

    3. 함의: 정책·방법론·국내 적용

    정책적으로, 본 연구는 안전 지표의 신뢰성이 “무엇을 세는가”보다 “어떻게 표준화되어 보고·검증되는가”에 더 크게 좌우됨을 시사한다. 따라서 시스템 실패 보고로의 전환은 그 자체로 비교가능성을 보장하지 않으며, 표준화된 필드·데이터 사전, 결측·비일관에 대한 보고 의무, 운영설계영역과 노출에 대한 정규화, 그리고 가능하다면 독립적 검증 절차가 함께 마련될 때 비로소 운영자 간 비교에 쓰일 수 있다. 지표의 재정의는 보고 표준화의 대체물이 아니라 그 위에서만 의미를 갖는다.

    방법론적으로, 운영자 단위로 군집화된 희소 카운트 패널에서는 통합 추세선이나 상관계수, 혹은 포아송 표준오차에 근거한 유의성 판단은 유의하지 않은 결과를 유의하다고 판정할 수 있다. 본 연구가 보였듯 동일한 점 추정치가 추론 방법에 따라 유의/비유의로 갈리므로, 자율차 운영자 패널 분석에서는 과대산포 진단, 소수클러스터 강건추론(특히 와일드 군집 부트스트랩), 공통기울기·레버리지 진단을 기본 절차로 삼는 것이 바람직하다.

    국내 적용 측면에서도 함의가 있다. 국내에서도 「자율주행자동차법」에 따른 시범운행지구와 「자동차관리법」 제27조에 따른 임시운행허가를 통해 실도로 실증이 확대되고 있으며, 안전성 평가·시험평가 체계가 정비되고 있다. 향후 국내 자율주행 운영·시험 데이터가 축적될 때, 지표를 정하기에 앞서 보고 항목과 데이터 사전을 표준화하고 결측·노출을 통제하는 것이 비교가능한 안전 지표의 전제가 된다는 본 연구의 교훈은 동일하게 적용된다. 또한 본 연구가 사용한 분석틀—운영자 고정효과 카운트 모형, 소수클러스터 강건추론, 이질성 검정—은 국내 자율주행 안전·시험평가 자료의 분석에도 직접 이전될 수 있다.

    4. 한계

    본 연구는 자료가 캘리포니아 한 관할권에 한정되어 결론을 다른 제도·환경으로 일반화할 때 주의가 필요하며, 월별 집계 카운트에 기반하므로 개별 해제의 맥락(운영설계영역·심각도 등)을 충분히 반영하지 못한다. 월별 집계는 사건 수준의 정보(시점·상황·심각도)를 담지 못하므로, 동일한 월 해제 건수라도 그 의미가 운영자·상황에 따라 다를 수 있다. 또한 노출 변수인 주행거리 역시 운영자 보고에 의존하므로 측정오차의 가능성이 있다. 실제로 offset의 단위탄력성 제약을 풀어 log(주행거리)를 자유 추정하면 Top10에서는 제약과 대체로 부합하지만(탄력성 0.93, β = 0.48 ), 전체 표본에서는 탄력성이 0.56으로 1을 크게 하회하고 β 도 −0.12로 축소된다 — 노출 보고의 이질성과 정합하며, 표면적 학습효과가 사양 선택에 취약하다는 결론과 같은 방향이다. 운영자의 진입·이탈 또한 성과와 무관하지 않을 수 있어(내생적 이탈), 운영자 내 기울기 추정 역시 생존 표본에 조건부다. 아울러 최초 보고자 파일을 제외하는 표본 기준상 일부 운영자(예: Beep)는 실제 운행 이력이 있어도 정규 연차 파일에 처음 등장하는 해에 표본에 진입하므로, 누적 주행거리(log_cum)가 표본 개시 이전의 경험을 반영하지 못하는 좌측 절단이 존재하며, 이는 표본 개시(2020년 12월) 이전 경험을 지닌 운영자 전반에 공통된다.

    아울러 시스템 개시 해제 부분집합은 새 시스템 실패 지표의 근사치일 뿐 동일하지 않으며, 그 구성은 운영자별 기재 관행과 표본 구성에 의해 제약된다. 다만 식별에 필요한 하위 필드의 기재조차 표준화되어 있지 않다는 이 제약 자체가 본 연구의 발견에 속하므로, 이 한계는 동시에 결과의 일부다. 향후 새 보고체계(DDT 시스템 실패 보고)의 데이터가 공개되면 동일한 분석틀로 전환의 효과를 재평가할 수 있으며, 복수 관할권·사건 수준 자료로 확장하면 학습효과와 보고 표준화의 관계를 더 정밀하게 규명할 수 있을 것이다.

    Ⅵ. 결 론

    본 연구는 캘리포니아 DMV 해제 자료를 대상으로 두 질문—누적주행에 따른 해제율 감소가 견고한 학습효과인지, 그리고 시스템 개시로의 보고체계 전환이 비교가능성과 추론 견고성을 개선하는지—에 답했으며, 두 답 모두 부정적이었다. 표면적 학습효과는 적절한 소수클러스터 추론하에서 유의성을 잃고 단일 운영자에 좌우되며 운영자 간에 부호가 엇갈렸고, 해제율은 운영자 간에 여러 자릿수로 분포해 통합 지표로서의 비교가능성이 성립하지 않았다. 지표를 시스템 개시 사건으로 좁혀도, 그 집계가 신규 운영자 1곳의 진입과 표준화되지 않은 기재 관행에 좌우되어 어느 축에서도 개선이 나타나지 않았다.

    본 연구의 기여는 두 가지다. 첫째, 질적·규제적으로만 합의되어 온 해제 지표의 한계를, 과대산포·소수클러스터·운영자 이질성을 정면으로 다룬 추론으로 통계적으로 검증하였다. 둘째, 폐지가 확정된 지표를 다른 지표로 대체하는 규제 전환의 효과를, 새 보고체계의 시행에 앞서 기존 자료로 검토하였다. 본 연구는 해제율과 사고·상해 등 실제 안전 결과의 관계를 직접 검증한 것이 아니므로, 해제율이 안전 지표로서 부적합하다는 일반적 결론을 제시하지 않는다. 본 연구가 확인한 것은 해제율을 운영자 간 비교와 기술 성숙도 평가의 지표로 사용할 때의 한계다. 본 연구의 결론은 결국 하나의 명제로 모인다: 비교가능하고 견고한 안전 지표의 전제는 사건 정의의 선택이 아니라 보고의 표준화·완전성이며, 지표 선택은 그 위에서만 의미를 갖는다. 향후 새 보고체계의 데이터가 축적되면 본 연구와 동일한 분석틀로 전환의 실제 효과를 재평가할 수 있을 것이다. 분석에 사용한 코드와 구축 자료는 요청 시 제공한다.

    Figure

    KITS-25-4-221_F1.jpg

    Per-operator learning slopes βi (Top 10); bars below zero indicate a declining disengagement rate with cumulative mileage, above zero an increasing rate

    KITS-25-4-221_F2.jpg

    Per-operator disengagement rate (per 1,000 miles, log scale), spanning roughly five orders of magnitude

    KITS-25-4-221_F3.jpg

    Share of mileage vs. share of disengagements by operator; Apple reports a large disengagement share (35.5%) from a small mileage share (3.1%), Waymo the opposite

    KITS-25-4-221_F4.jpg

    Annual AV-system-initiated disengagements (bars; single 2025 entrant vs. others) and the AV-system share of known disengagements (line); the 2025 surge reflects one new entrant (Beep)

    Table

    Panel descriptive statistics and annual totals

    Learning-effect estimates and significance by inference method

    Operator leave-one-out leverage (top 6; full-sample β=−0.359)

    Cross-operator comparability indicators (Top 10, by mileage)

    Evaluation of the reporting transition: total vs. AV-system-initiated disengagements

    Reference

    1. Allison, P. D. and Waterman, R. P. ( 2002), “Fixed-Effects Negative Binomial Regression Models”, Sociological Methodology, vol. 32, no. 1, pp.247-265.
    2. Banerjee, S. S., Jha, S., Cyriac, J., Kalbarczyk, Z. T. and Iyer, R. K. ( 2018), “Hands off the wheel in autonomous vehicles? A systems perspective on over a million miles of field data”, Proceedings of the 48th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), pp.586-597.
    3. Blumenthal, M. S., Fraade-Blanar, L., Best, R. and Irwin, J. L. ( 2020), Safe Enough: Approaches to Assessing Acceptable Safety for Automated Vehicles, RAND Corporation, Santa Monica, CA (RR-A569-1).
    4. California DMV ( 2026a), Autonomous Vehicle Permit Holders in California Logged More Than 9 Million Test Miles Between December 1, 2024 and November 30, 2025, California Department of Motor Vehicles [News Release], Feb. 20, 2026, https://www.dmv.ca.gov/portal/news-and-media/autonomous-vehicle-permit-holders-in-california-logged-more-than-9-million-test-miles-between-december-1-2024-and-november-30-2025/, accessed July 19, 2026.
    5. California DMV ( 2026b), Final Statement of Reasons: Autonomous Vehicle Testing and Deployment Regulations, California Department of Motor Vehicles, https://www.dmv.ca.gov/portal/vehicle-industry-services/autonomous-vehicles/california-autonomous-vehicle-regulations/, accessed July 19, 2026.
    6. Cameron, A. C., Gelbach, J. B. and Miller, D. L. ( 2008), “Bootstrap-based improvements for inference with clustered errors”, Review of Economics and Statistics, vol. 90, no. 3, pp.414-427.
    7. Cameron, A. C. and Miller, D. L. ( 2015), “A practitioner’s guide to cluster-robust inference”, Journal of Human Resources, vol. 50, no. 2, pp.317-372.
    8. Cameron, A. C. and Trivedi, P. K. ( 2013), Regression Analysis of Count Data, 2nd ed., Cambridge University Press, Cambridge, UK.
    9. Dixit, V. V., Chand, S. and Nair, D. J. ( 2016), “Autonomous vehicles: Disengagements, accidents and reaction times”, PLoS ONE, vol. 11, no. 12, e0168054.
    10. Favarò, F. M., Nader, N., Eurich, S. O., Tripp, M. and Varadaraju, N. ( 2017), “Examining accident reports involving autonomous vehicles in California”, PLoS ONE, vol. 12, no. 9, e0184952.
    11. Favarò, F., Eurich, S. and Nader, N. ( 2018), “Autonomous vehicles’ disengagements: Trends, triggers, and regulatory limitations”, Accident Analysis & Prevention, vol. 110, pp.136-148.
    12. Hausman, J., Hall, B. H. and Griliches, Z. ( 1984), “Econometric models for count data with an application to the patents-R&D relationship”, Econometrica, vol. 52, no. 4, pp.909-938.
    13. Hyun, S. H., Son, J. W., Oh, Y. C. and You, B. Y. ( 2024), “A study of the DSSAD data elements derivation through autonomous driving data analysis on expressways”, The Journal of The Korea Institute of Intelligent Transport Systems, vol. 23, no. 3, pp.97-106.
    14. Jo, Y., Jung, A., Oh, C., Park, J. H. and Yun, D. G. ( 2022), “Suitability Evaluation for Simulated Maneuvering of Autonomous Vehicles”, The Journal of The Korea Institute of Intelligent Transport Systems, vol. 21, no. 2, pp.183-200.
    15. Kohanpour, E., Davoodi, S. R. and Shaaban, K. ( 2025), “Trends in autonomous vehicle performance: A comprehensive study of disengagements and mileage”, Future Transportation, vol. 5, no. 2, 38.
    16. Lee, H. Y., Jee, J. H., Oh, C. and Kim, H. S. ( 2024), “Derivation of driving stability indicators for autonomous vehicles based on analyzing Waymo Open Dataset”, The Journal of The Korea Institute of Intelligent Transport Systems, vol. 23, no. 4, pp.94-109.
    17. MacKinnon, J. G. and Webb, M. D. ( 2017), “Wild bootstrap inference for wildly different cluster sizes”, Journal of Applied Econometrics, vol. 32, no. 2, pp.233-254.
    18. MacKinnon, J. G. and Webb, M. D. ( 2018), “The wild bootstrap for few (treated) clusters”, Econometrics Journal, vol. 21, no. 2, pp.114-135.
    19. Min, J., Hong, Y., King, C. B. and Meeker, W. Q. ( 2022), “Reliability analysis of artificial intelligence systems using recurrent events data from autonomous vehicles”, Journal of the Royal Statistical Society Series C: Applied Statistics, vol. 71, no. 4, pp.987-1013.
    20. Park, J. H., Yun, D. G., Lim, K. W., Lee, J. D. and Chang, I. J. ( 2024), “A study on the disengagement of autonomous mode for mass-produced vehicle”, The Journal of The Korea Institute of Intelligent Transport Systems, vol. 23, no. 6, pp.382-389.
    21. Roodman, D., Nielsen, M. Ø., MacKinnon, J. G. and Webb, M. D. ( 2019), “Fast and wild: Bootstrap inference in Stata using boottest”, Stata Journal, vol. 19, no. 1, pp.4-60.
    22. SAE International ( 2021), Taxonomy and Definitions for Terms Related to Driving Automation Systems for On-Road Motor Vehicles (J3016_202104), SAE International, Warrendale, PA.
    23. Sinha, A., Chand, S., Vu, V., Chen, H. and Dixit, V. ( 2021), “Crash and disengagement data of autonomous vehicles on public roads in California”, Scientific Data, vol. 8, 298.
    24. Skokan, A. and Mareček, J. ( 2025), “Could disengagement reports indicate evolution of autonomous vehicles?”, Vehicles, vol. 7, no. 2, 32.
    25. Vogt, K. ( 2020), “The Disengagement Myth”, Medium, https://medium.com/cruise/the-disengagement-myth-1b5cbdf8e239, accessed June 27, 2026.
    26. Yun, H., Kim, S. L., Lee, J. W. and Yang, J. H. ( 2018), “Analysis of Cause of Disengagement Based on U.S. California DMV Autonomous Driving Disengagement Report”, Transactions of the Korean Society of Automotive Engineers, vol. 26, no. 4, pp.464-475.

    저자소개

    Footnote