AI 도입과 성과평가 체계 개편 — 개인 KPI에서 무엇이 먼저 바뀌어야 하는가
기업이 AI를 들이는 순서는 보통 도구 배포, 교육, 그리고 성과평가 반영 순으로 간다. 문제는 세 번째 단계다. 도구를 나눠주고 교육까지 마친 회사들이 막상 "그래서 누가 AI를 잘 쓰고 있는가"를 평가 항목에 넣으려 할 때, 측정 대상을 사용량으로 잡는 경우가 많다. 그리고 그 선택이 생각보다 빨리 역풍을 맞고 있다.
사용량을 평가 항목에 넣은 회사들
쇼피파이(Shopify)의 최고경영자 토비 뤼트케(Tobi Lütke)는 2025년 4월 사내 메모에서 AI 활용을 전 직원의 기본 역량으로 규정했다. 팀이 인력 충원을 요청하기 전에 "AI로 왜 이 일을 할 수 없는지"를 먼저 설명해야 한다는 조건을 달았고, AI 사용 여부를 성과평가와 동료평가 질문지에 포함시켰다.
메타(Meta)는 2025년 말 방침을 예고하고 2026년부터 공식 적용에 들어갔다. 엔지니어링·마케팅·운영 등 여러 직군에서 관리자가 직원의 AI 도구(사내 코딩 어시스턴트 메타메이트 등) 활용도를 평가에 반영하도록 가이드라인을 마련했고, 전환을 돕는다는 명목으로 "AI 퍼포먼스 어시스턴트"라는 보조 도구까지 함께 내놓았다.
JP모건체이스(JPMorgan Chase)는 2026년 3월 더 정량적인 방식을 택했다. 약 6만 5,000명의 엔지니어를 대상으로 코드 보조 도구인 깃허브 코파일럿(GitHub Copilot) 사용 빈도를 추적해 '라이트 유저', '헤비 유저', '논유저'로 분류하고, 이 분류를 부서 내 사용률 중앙값과 비교한 점수로 성과평가 자료에 올렸다. 헤비 유저는 "참여도 높은 얼리어답터"로, 논유저는 "행동 리스크"로 분류돼 관리자와의 면담 대상이 된다는 보도가 나왔다.
세 회사의 방식은 다르지만 전제는 같다. AI를 얼마나 많이 쓰는지가 그 사람이 AI를 잘 활용하고 있다는 증거라는 전제다.
측정이 목표가 되는 순간 생기는 일
이 전제는 아마존(Amazon)에서 가장 분명하게 무너졌다. 사내에서 '키로랭크(KiroRank)'로 불린 리더보드는 자체 AI 코딩 도구 키로(Kiro)의 사용량을 기준으로 직원 순위를 매겼는데, 2026년 6월 초 회사가 이 리더보드를 폐쇄했다. 직원들이 순위를 끌어올리려고 의미 없는 요청을 반복해 사용 기록만 쌓는 식으로 지표를 조작했기 때문이다. 보도에 따르면 조작에 나선 직원 중 한 명은 성과평가 자리에서 "AI를 충분히 쓰지 않는다"는 지적을 받은 뒤부터 그렇게 했다고 말했다. 평가가 행동을 바꾼 것은 맞지만, 바뀐 행동이 실제 업무 개선과는 무관했던 셈이다.
비슷한 문제가 메타 내부에서도 나타났다. 토큰 소비량으로 약 8만 5,000명의 직원 순위를 매긴 사내 리더보드가 있었는데, 여기서도 업무와 무관하게 토큰 소모량만 늘리는 행태가 나타났다는 보도가 있었다. 영업 조직을 대상으로 한 한 연구에서는 AI 질의 횟수가 많을수록 오히려 영업 성과가 낮아지는 상관관계가 확인됐는데, 질이 낮고 급하게 반복된 질의가 시간만 소모했을 가능성이 지적됐다. 측정이 목표가 되는 순간 그 측정은 더 이상 좋은 지표가 아니게 된다는, 오래된 거버넌스 원칙(굿하트의 법칙)이 AI 도입 국면에서 그대로 재현되고 있는 모습이다.
활동량이 아니라 판단을 재는 쪽으로
그렇다고 AI 활용도를 평가에서 완전히 빼는 것이 답은 아니다. 조직이 AI 역량을 키우도록 유도하려는 목적 자체는 합리적이다. 문제는 측정 대상의 설계다. 사용 빈도나 토큰 수처럼 조작하기 쉬운 활동 지표 대신, 그 활용이 실제로 바꾼 결과를 봐야 한다는 쪽으로 논의가 옮겨가고 있다. 예컨대 AI 보조 도구 도입 전후로 업무 처리 속도나 오류율이 어떻게 달라졌는지, 고객이 체감하는 응답 품질이 개선됐는지를 보는 방식이다. 마케팅 기술 기업 콘덕터(Conductor)처럼 '모범 사례'부터 '역량을 보여주지 못함'까지 단계별 서술형 기준을 두고 관리자가 구체적 사례를 근거로 판단하게 하는 접근도 같은 방향이다. 숫자 하나로 환원하기보다, 관리자가 실제 업무 맥락에서 판단하도록 설계를 바꾸는 쪽이다.
이 전환에는 비용이 따른다. 사용량 지표는 집계가 쉽고 자동화할 수 있지만, 결과 중심 지표는 관리자의 판단이 다시 개입해야 해서 평가 과정이 느려지고 주관성이 커진다. 그럼에도 활동량 지표가 처음부터 조작 가능성을 안고 출발한다는 점을 감안하면, 느리더라도 결과 중심으로 가는 쪽이 장기적으로 덜 위험한 선택이다.
한국 기업에 주는 시사점
한국 기업 다수는 아직 AI 활용도를 개인 평가 항목에 넣는 단계 이전에 있다. 그만큼 해외 사례의 실패 지점을 미리 피할 여지가 있다는 뜻이기도 하다. 사용 로그나 접속 빈도 같은 손쉬운 지표로 평가 체계를 설계하려는 유혹이 나타날 때, 그 지표가 조작 가능한지부터 먼저 점검할 필요가 있다. 그리고 애초에 어떤 업무에서 AI 활용이 어떤 결과 변화로 이어져야 하는지를 부서별로 먼저 정의한 뒤에 지표를 설계하는 순서가, 사용량부터 재고 결과를 나중에 찾는 순서보다 실패 확률이 낮다.
참고한 자료
- Shopify CEO says employees must prove AI can't do the job before any new hires are approved – Business Insider / 관련 보도 종합
- Meta may lower appraisals for employees who don't use AI enough – Storyboard18
- JPMorgan Now Tracks Employee AI Usage in Performance Reviews
- Amazon workers are gaming the AI leaderboard. HR built it – HCAMag
- Amazon scraps AI leaderboard after workers caught cheating – Mediaweek