전자의무기록 전체를 생성형 AI 챗봇에 올려 요약과 건강 조언을 받는 시도가 실제로 이뤄졌습니다. 환자 포털에서 기록을 내려받아 형식을 맞추는 데 약 5분이면 충분했고, 챗봇은 흩어진 검사 수치와 진료 이력을 읽을 만한 서사로 정리한 뒤 생활 습관 개선 방향까지 제시했습니다. 그런데 같은 계열의 서비스 가운데 하나인 ChatGPT Health를 표준 응급 시나리오로 검증한 연구에서는 응급 상황의 52%를 놓쳤습니다. 어디까지 맡기고 어디부터 직접 판단해야 하는지가 지금의 핵심 질문입니다.

의료 기록을 읽는 AI의 힘

AI가 의료 데이터를 다루는 방식은 사람이 읽는 방식과 다릅니다. 수년치 전자의무기록과 유전 정보를 베이지안 프레임워크로 묶어 다유전자 위험 점수를 계산하고, 임상 증상이 나타나기 몇 년 전에 질병 경로를 예측하는 연구가 학술지에 실렸습니다. 다유전자 위험 점수는 여러 유전자 변이를 합산해 질병 가능성을 추정하는 지표입니다.

일정량 이상의 반응 데이터를 학습한 추천 알고리즘이 동료나 가족보다 사용자를 더 잘 안다는 관찰과 겹치는 대목입니다. 사람이 증상을 자각하거나 병원을 찾기 훨씬 전에 몸속 이상 신호를 감지할 수 있다는 기대가 여기서 나옵니다.

더 나아가 자율 AI 단독 진료가 앞으로 몇 년 안에 의사를 능가할 수 있다는 관점도 학술지에 제기됐습니다. 종양학자이자 의료윤리학자인 Ezekiel Emanuel과 투자자 Vinod Khosla가 제시한 이 주장은 AI 진료의 상한선을 어디로 볼 것인가라는 논쟁을 키웁니다. 다른 방향의 자료도 있습니다. 한 전문 학회는 향후 30년간 영상의학과 전문의 수가 26% 늘어날 것으로 전망합니다.

진료실의 AI는 행정 업무에서 먼저 쓰입니다

실제 임상에서 AI가 가장 먼저 자리를 잡은 곳은 진단이 아니라 행정입니다. 한 대학병원 비뇨기과에서는 수술 전에 복용을 잠시 중단해야 하는 약물 목록을 검토하는 데 매주 직원 5~10시간이 들었습니다. 여기에 AI 워크플로를 붙이면서 주간 수술 환자 전체의 약물 교차 확인이 5분 안에 끝나게 됐습니다.

설계 원칙이 눈에 띕니다. 이 흐름에는 의도적으로 마찰이 남아 있고, 사람이 반드시 검토하는 단계가 유지됩니다. 어떤 결정도 확인 없이 자동 실행되지 않습니다. 신뢰는 검증 위에서만 성립한다는 판단입니다.

경고도 따라붙습니다. 자동화에 익숙해지면 숙련된 임상의도 검토 단계를 무의식적으로 건너뛸 수 있습니다. 자동화가 주는 안심이 판단력을 무디게 만드는 현상입니다. AI가 인지적 평가를 대신할수록 의사의 실무 능력 자체가 퇴화할 수 있다는 우려도 제기됩니다.

수술 전 약물 검토 화면을 함께 확인하는 의료진

▲ 수술 전 약물 검토 자동화

응급 상황 52%를 놓친 챗봇

가장 뾰족한 수치는 응급 분류에서 나왔습니다. 응급 분류는 증상의 긴급도를 판단해 진료 우선순위를 정하는 과정입니다. 표준화된 응급 시나리오를 제시한 검증에서 ChatGPT Health는 52%의 사례에서 긴급 진료를 권하지 않고 환자를 집에 머물게 했습니다. 결과는 의학 학술지 Nature Medicine에 실렸습니다.

  • 천식 악화: 12시간 동안 구조용 흡입기를 4회 사용하고 호흡곤란이 악화된 환자에게 24~48시간 집에서 지내라고 권했습니다.
  • 자살 사고: 실직 후 자살을 생각하는 환자에게 정상 범위의 혈액 검사 결과를 입력하자 위기 상담 전화 안내가 사라지고 비의료적 문제로 처리했습니다.

구버전 모델을 대상으로 한 연구라는 반박도 있었습니다. 그러나 7개 모델과 여러 차례 주고받는 대화 형식으로 다시 시험해도 같은 편향이 반복됐습니다. 이 모델을 만든 OpenAI는 연구가 이미 대체된 모델을 분석했고 연구 방식이 실제 사용자 상호작용과 맞지 않는다고 반박했습니다. 두 주장이 엇갈리지만, 정상 수치나 안심시키는 표현이 응급도를 낮추는 방향으로 작동할 수 있다는 관찰은 임상 현장에 중요한 경고입니다.

3명 중 1명은 이미 AI에 건강을 묻습니다

미국 성인 3명 중 1명, 약 6,600만 명이 건강 정보를 얻기 위해 AI를 사용한 경험이 있다는 조사 결과가 있습니다. 이전 기술 도입이 주로 고소득·고학력 집단에서 먼저 나타났던 것과 달리 AI 건강 도구는 인구 집단 경계를 넘어 널리 쓰입니다.

환자들은 진료실에 AI가 출력한 자료를 들고 옵니다. 자기 몸에 대한 주도권을 주장하고 진단의 불확실성을 견디려는 행동입니다. 이런 자료를 설명하느라 진료 시간이 길어지지만, 그 대화가 환자의 숨은 불안을 드러내 주기에 오히려 환영할 일이라는 시각도 있습니다.

문제는 AI가 의학적 불확실성을 표현하도록 훈련되지 않는다는 점입니다. 개발자들이 모델을 확신에 찬 정답 엔진처럼 들리게 훈련하고 있다는 경고도 나옵니다. 반면 전공의 교육에서 가장 신뢰받는 임상의는 즉답을 잘하는 사람이 아니라 모르는 것을 솔직히 말하고 책임을 지는 사람입니다. 모델이 자기 불확실성을 인식하도록 훈련하는 것이 결국 정확도와 신뢰를 함께 높이는 길이라는 지적입니다.

밤에 집에서 스마트폰으로 건강 상담을 하는 사람

▲ 환자의 AI 건강 상담

FRESH: 챗봇에 건강을 물을 때 지킬 다섯 원칙

환자가 직접 챗봇과 상호작용할 때 쓸 수 있는 실전 원칙이 FRESH라는 기억법으로 정리됐습니다.

원칙 뜻 실천
F 사실 먼저 증상과 검사 수치를 그대로 입력하고, 안심하거나 축소하는 전제를 붙이지 않습니다.
R 대화 초기화 새로운 증상마다 새 대화를 열어 앞선 맥락이 판단을 끌고 가지 않게 합니다.
E 근거와 위험 검토 확실한지, 의사라면 어떤 위험과 반론을 제기할지 되묻습니다.
S 사람에게 진료받기 AI 답변은 진료 전 준비로만 쓰고 확정 진단으로 삼지 않습니다.
H 고위험에서는 자신을 믿기 위험 신호가 있으면 챗봇을 건너뛰고 즉시 응급 진료를 받습니다.

F가 특히 중요합니다. 가족이 과민반응이라고 한다거나 의사가 스트레스 때문이라고 했다는 전제를 먼저 깔면 모델의 진단 경계가 체계적으로 낮아집니다. R은 대화가 길어질수록 앞선 맥락이 뒤의 판단을 끌고 가는 현상을 막습니다. E는 모델에게 반론과 위험을 직접 요구하는 절차입니다.

위험 신호는 챗봇 없이 응급실로

다음은 즉시 응급 평가가 필요한 위험 신호입니다.

  • 각혈
  • 갑작스러운 한쪽 저림(감각 저하)
  • 고열
  • 걸을 수 없을 정도의 쇠약
  • 대소변 조절 상실

자살이나 자해를 생각할 만큼 힘든 위기 상황이라면 챗봇 대신 자살예방상담전화 109나 119에 바로 연락해야 합니다.

규제는 기술을 따라잡을 수 있을까

규제 논의도 진행 중입니다. 한 AI 연구 기업은 외부 행위자가 모델을 생물무기 합성에 악용하려 한 시도를 차단한 과정을 150쪽이 넘는 안전 보고서로 공개했습니다. 다만 상업적 자기규제만으로 충분한지에 대해서는 회의적인 시각이 있습니다. 내부 benchmark가 아니라 외부의 사전적이고 실제적인 임상 시험으로 안전성을 입증한 뒤 공공 의료 체계에 투입해야 한다는 요구입니다. 핵무기 확산을 막으려던 초기 국제 외교의 실패에 비유하며, 기술이 거버넌스를 앞지르기 전에 표준을 세울 시간이 2~3년에 불과하다는 경고도 나옵니다.

가장 큰 걸림돌은 기술의 성질 자체입니다. 최신 심층 신경망은 내부 표현을 만든 사람조차 완전히 이해하지 못합니다. 작동 원리가 블랙박스로 남아 있는 한 규제 경계를 긋기도 어렵습니다. 주요국 간 경쟁 구도가 강하게 작용하는 점도 규제 속도를 늦춥니다. 낙관적인 그림도 있습니다. 의사가 맞춤형 AI agent를 감독하면서 하루 10명 수준의 진료 역량을 수천 명 규모로 확장하되 품질을 지키는 방식입니다.

성능이 좋다는 것과 진료를 잘한다는 것은 다릅니다

자율주행차처럼 통계적으로 안전해도 단 한 번의 치명적 실패가 큰 반발을 부릅니다. AI 진료에도 같은 잣대가 적용됩니다. 정확도에 대한 기대는 매우 높은데 기본 신뢰는 낮은 이중 구조가 자리합니다.

핵심은 성능과 돌봄의 차이입니다. 성능은 정확한 계산으로 문제를 해결하는 능력입니다. 돌봄은 결과를 바꿀 수 없는 순간에도 곁을 지키고 책임을 나누는 일입니다. 1년 안에 사망에 이를 수 있는 뇌종양이나 방광암 진단을 앞둔 환자를 마주하는 상황을 떠올리면 차이가 분명해집니다. 알고리즘은 과거 데이터로 훈련된 뒤돌아보는 모델입니다. 수술 합병증이 생겼을 때 그 한 사람의 삶에 감정적 무게와 책임을 지는 일은 소프트웨어가 대신할 수 없습니다. 환자가 진료 말미에 선생님이라면, 어머니나 딸이라면 어떻게 하시겠느냐고 묻는 이유도 여기에 있습니다. 감정적 취약성도, 가족으로서 걸린 이해관계도, 공감 능력도 없는 AI는 이 질문에 답할 수 없습니다.

정리하면 이렇습니다. AI는 방대한 기록을 빠르게 정리하고 진료를 보조하는 강력한 도구이지만, 확정 진단의 권위를 갖지는 못합니다. 그래서 챗봇을 쓸 때는 다음을 지킵니다.

  • 생성형 챗봇은 진단 권위가 아니라 정보 정리 도구로만 다룹니다.
  • 증상을 물을 때는 FRESH 원칙을 적용하고, 정상 수치나 주변의 안심 발언을 먼저 붙이지 않습니다.
  • 각혈, 갑작스러운 한쪽 저림(감각 저하), 고열, 보행 불가, 대소변 조절 상실 같은 위험 신호가 있으면 챗봇을 건너뛰고 응급 진료를 받습니다.
  • 챗봇이 낸 답은 진료 전 준비 자료로 쓰고, 건강에 관한 판단은 의료진과 상의합니다.