HR 부서의 AI 전환 — 채용·평가·이탈 예측에서 실제로 검증된 사례는 어디인가
HR 업무에 AI를 들이는 논의는 대개 채용, 성과평가, 이탈 예측 세 영역을 뭉뚱그려 이야기한다. 그런데 세 영역의 검증 수준은 서로 다르다. 채용 스크리닝은 십 년 가까이 쌓인 공개 사례가 있고, 이탈 예측은 한 회사의 유명한 사례가 업계 전체의 준거점처럼 반복 인용된다. 성과평가는 벤더의 제품 소개는 많지만, 독립적으로 검증된 수치가 공개된 사례는 상대적으로 드물다. 이 차이 자체가 이 분야에서 무엇을 믿고 무엇을 경계해야 하는지에 대한 첫 번째 정보다.
채용에서 가장 먼저 나타나는 성과, 그리고 같은 자리에서 반복되는 편향 리스크
유니레버(Unilever)의 채용 자동화 사례는 이 분야에서 가장 자주 인용되는 사례다. 회사는 신입·인턴 채용에 히어뷰(HireVue)의 화상 인터뷰 분석과 파이메트릭스(Pymetrics)의 게임 기반 역량 평가를 도입해 연간 약 25만 건의 지원서를 처리하는 과정을 재설계했다. 여러 사례 연구에 따르면 이 과정에서 채용 소요 기간이 몇 달 단위에서 몇 주 단위로 줄었고, 채용 담당자의 면접 시간이 연간 5만 시간 이상 절감됐으며, 그로 인한 비용 절감이 연간 100만 파운드(약 17억원) 수준으로 보고됐다.
문제는 같은 기술이 반대 방향의 유명한 실패 사례도 만들었다는 점이다. 아마존(Amazon)은 2014년부터 이력서 자동 평가 엔진을 개발했지만, 과거 10년치 이력서 데이터의 대다수가 남성 지원자였던 탓에 모델이 "여성"이라는 단어가 포함된 이력서와 여자대학 졸업자를 체계적으로 낮게 평가한다는 사실이 드러나 2018년 프로젝트를 폐기했다. 히어뷰 역시 2021년 얼굴 표정 분석 기능을 제품에서 제거했는데, 회사 자체 데이터 과학자의 분석에서 얼굴 데이터가 예측력에 기여하는 비중이 0.25퍼센트 수준에 그친다는 결과가 나온 데다, 자폐 스펙트럼이나 안면 비대칭이 있는 지원자를 차별할 수 있다는 비판과 미국 전자프라이버시정보센터(EPIC)의 연방거래위원회 제소가 겹친 결과였다.
이 편향 문제는 과거형이 아니다. 블룸버그(Bloomberg)가 2024년 진행한 실험에서는 오픈에이아이(OpenAI)의 GPT 모델에 인종별로 뚜렷하게 구분되는 이름의 이력서를 투입했을 때 특정 인종 집단의 이름이 체계적으로 불리하게 평가됐고, 워싱턴대학교 연구진의 같은 해 논문에서도 대규모 언어모델이 백인으로 인식되는 이름을 약 85퍼센트, 여성으로 인식되는 이름을 약 11퍼센트의 빈도로만 선호하는 편향이 관찰됐다. 채용 스크리닝은 도입 효과가 가장 빨리 나타나는 영역인 동시에, 학습 데이터의 과거 편향을 그대로 재생산하는 위험이 가장 뚜렷한 영역이기도 하다.
이탈 예측 — 검증된 성과 뒤에 숨은 인과관계 질문
이탈 예측 분야에서는 IBM의 사례가 거의 유일하다시피 반복 인용된다. IBM은 왓슨(Watson) 기반의 '예측적 이탈 프로그램'을 통해 6개월 내 퇴사 가능성이 있는 직원을 약 95퍼센트 정확도로 예측한다고 밝혔고, 2019년 당시 최고경영자였던 지니 로메티(Ginni Rometty)는 이 프로그램으로 누적 약 3억 달러(약 4,200억원)의 인력 유지 비용을 절감했다고 공개했다.
이 수치를 읽을 때는 두 가지를 함께 봐야 한다. 하나는 이 사례가 업계에서 가장 널리 인용되는 만큼 검증된 성과처럼 다뤄지지만, 실제로는 IBM이 자체 발표한 단일 수치이며 산출 방식이나 비교 대상이 외부에 상세히 공개된 적은 없다는 점이다. 다른 하나는 이탈 예측 모델이 실제로 하는 일이 퇴사 가능성이 높은 직원을 짚어내는 것까지이지, 그 직원을 붙잡는 것은 결국 관리자의 개입이라는 점이다. 예측의 정확도와 조직이 그 예측에 따라 실제로 무엇을 하는지는 별개의 문제이며, 후자를 검증한 독립 연구는 아직 찾기 어렵다.
성과평가 영역은 이 둘보다도 공개 사례가 얕다. 여러 HR 소프트웨어 기업이 관리자의 피드백 품질을 AI가 채점하거나 목표 설정을 돕는 기능을 출시했지만, 도입 전후 성과 변화를 수치로 공개하고 제3자가 검증한 사례는 이 글을 쓰는 시점에는 확인되지 않는다. 채용과 이탈 예측이 비교적 명확한 성공·실패 지표(채용 기간, 퇴사 여부)를 갖는 반면, 성과평가는 '평가의 질'이라는 것 자체가 측정하기 어려운 개념이라는 점이 이 공백의 한 원인으로 보인다.
재무적으로 무엇이 움직이는가
세 영역이 움직이는 손익 항목은 서로 다르다. 채용 자동화는 판매관리비 안의 채용 담당 인건비와 외부 채용대행 수수료를 줄이고, 결원 상태로 남는 기간을 단축해 그 자리의 매출 기여 공백을 좁힌다. 이탈 예측은 핵심 인재 한 명을 대체하는 데 드는 채용·교육·생산성 공백 비용(통상 해당 직원 연봉의 절반에서 두 배 사이로 추정된다는 것이 여러 인사 컨설팅 자료의 공통된 범위다)을 줄이는 방향으로 작동한다. 성과평가는 아직 손익 항목으로 연결할 만큼 검증된 사례가 부족하다.
세 영역 모두에서 공통된 것은, 이 절감이 같은 인력으로 더 많은 지원자를 검토하고 더 빨리 결원을 채우는 데서 나온다는 점이다. 채용팀의 처리 용량이 늘어나면 회사가 성장할 때 채용팀 인원을 그만큼 늘리지 않아도 되고, 이탈 예측이 핵심 인재 이탈을 줄이면 그 자리를 다시 채우는 채용 비용과 공백 기간이 애초에 발생하지 않는다.
한국 기업에 주는 시사점
한국의 중견기업이 HR AI 도입을 검토할 때는 이 검증 수준의 차이를 그대로 반영하는 것이 합리적이다. 채용 스크리닝은 도입 효과가 상대적으로 빨리, 뚜렷하게 나타나지만 그만큼 편향 검증 절차를 함께 설계해야 한다는 것이 해외 사례가 반복해서 주는 교훈이다. 이탈 예측은 참고할 만한 방향이지만, 벤더가 제시하는 정확도 수치를 그대로 재무 효과로 환산하기보다는 예측 이후 실제로 어떤 개입이 이뤄지는지를 함께 설계해야 실효가 난다. 성과평가는 아직 해외에서도 검증된 사례가 얕은 영역이라는 점을 인지하고, 도입을 서두르기보다 다른 두 영역에서 먼저 데이터를 쌓는 편이 순서에 맞다.
참고한 자료
- AI Case Study: Unilever saved over 50,000 hours in candidate interview time - Best Practice AI
- Amazon scraps secret AI recruiting tool that showed bias against women - Reuters
- HireVue drops facial-expression analysis amid AI algorithm audit - Fortune
- OpenAI's GPT Shows Bias in Résumé Screening Experiment - Bloomberg
- IBM artificial intelligence can predict with 95% accuracy which workers are about to quit their jobs - CNBC