GPT-4가 혼자 푼 진단 추론 과제에서 AI를 활용한 의사보다 수치상 좋은 결과를 냈습니다. 그렇다고 의사를 빼면 더 안전한 진료가 된다는 뜻은 아닙니다. 이 결과가 먼저 보여주는 것은 모델의 지식과 사람이 그 지식을 사용하는 능력이 다르다는 점입니다. 질문에 담긴 선입견, 긴 의료 기록에서 빠지는 정보, 판단에 대한 책임까지 살펴야 AI의 성능을 의료 현장의 신뢰로 연결할 수 있습니다.
단독 성능과 협업 성능을 나눠 봐야 합니다
Stanford Medicine의 의사가 공동으로 참여한 무작위 대조 연구에서는 현직 의사 70명의 진단 추론 방식을 비교했습니다. AI를 먼저 활용하거나 자신의 판단 뒤에 두 번째 의견으로 활용한 경우 모두 기존 의료 자료를 사용한 경우보다 정확도가 높았습니다. 그러나 GPT-4 단독 결과는 AI와 협업한 의사들의 결과보다 수치상 더 높았습니다.
| 비교 조건 | 진단 정확도 |
|---|---|
| AI를 첫 번째 의견으로 활용한 의사 | 85% |
| AI를 두 번째 의견으로 활용한 의사 | 82% |
| 기존 의료 자료를 활용한 의사 | 75% |
별도의 무작위 임상시험에서는 내과·가정의학과·응급의학과 의사 50명을 대상으로 진단 추론을 평가했습니다. 여기서도 LLM(대규모 언어 모델) 단독 점수가 의사보다 약 16%포인트 높았습니다. 두 연구가 던지는 질문은 AI를 쓸지 말지가 아니라, 높은 성능의 AI를 의사가 어떤 방식으로 활용해야 그 이점을 살릴 수 있느냐입니다.
다만 여기서 비교한 것은 정해진 과제의 진단 추론 결과입니다. 이를 실제 환자를 만나는 진료의 안전성이나 최종 치료 결과와 동일하게 읽어서는 안 됩니다. 진료에는 자료를 해석하는 능력 외에도 환자와의 소통, 불확실한 상황에서의 판단, 결정에 대한 책임이 필요합니다.

▲ 단독 사용과 협업의 차이
질문에 실린 가설이 답을 흔듭니다
협업 성능이 기대에 못 미친 이유 가운데 하나는 질문 방식입니다. 초기 시험에 참여한 의사 중에는 대화형 AI를 사용해 본 적이 없는 사람도 많았습니다. 모델을 쓸 수 있다는 사실만으로 적절한 질문을 구성하거나 답을 비판적으로 검토하는 능력까지 생기지는 않습니다.
특정 질환을 먼저 떠올린 뒤 그 가능성을 확인해 달라고 물으면, 모델이 질문 속 가설에 동조할 수 있습니다. 이를 sycophancy(사용자의 기대나 암시에 맞춰 답하는 경향)라고 합니다. 사람 역시 처음 떠올린 설명에 매이는 anchoring(초기 가설에 판단이 묶이는 경향)의 영향을 받을 수 있습니다. 두 경향이 겹치면 AI는 잘못된 추정을 바로잡기보다 강화하는 도구가 됩니다.
일반인 1,295명이 참여한 별도 연구도 이 간극을 보여줍니다. LLM은 단독으로 평가받았을 때 상황 속 질환을 94.9% 식별했지만, AI를 사용할 수 있었던 일반인은 AI 없이 답한 사람보다 질환 식별 성적이 낮았습니다. 모델 자체의 점수와 사람이 모델을 이용해 얻는 결과를 구별해야 하는 이유입니다. 특히 의료 지식이 없는 사용자가 두려워하는 질환을 질문에 먼저 담으면 답의 방향도 그쪽으로 쏠릴 수 있습니다.
긴 의료 기록에서는 빠진 정보가 문제가 됩니다
AI가 그럴듯한 설명을 내놓아도, 판단에 꼭 필요한 내용이 입력과 출력 사이에서 사라질 수 있습니다. Gemini 2.5 Pro를 임상 기록 요약에 적용한 연구에서는 사실과 다른 내용을 만들어내는 오류보다 중요한 임상 정보를 누락하는 오류가 두드러졌습니다. 긴 병원 기록을 짧게 요약하려면 무엇을 남기고 버릴지 선택해야 하기 때문입니다.
여러 해에 걸친 검사 수치와 날짜를 다룰 때는 context rot(긴 자료 속에서 앞뒤 맥락이나 시간 순서를 놓치는 현상)도 문제가 됩니다. 기록에 들어 있는 내용이 모두 확인된 사실인 것도 아닙니다. 확인되지 않은 추정이 이전 진료 기록에서 다음 기록으로 계속 옮겨지면, AI 역시 반복된 내용을 검증된 병력처럼 받아들일 수 있습니다. 이런 현상은 chart lore(검증되지 않은 정보가 의료 기록에서 사실처럼 굳어지는 현상)로 설명됩니다.
따라서 요약문이 매끄러운지보다 중요한 소견과 시간 순서가 보존됐는지를 확인하는 일이 중요합니다. AI의 요약은 의료진이 원래 기록과 대조하며 검토할 자료이지, 원래 기록을 대체하는 최종 판단문이 아닙니다.

▲ 의료 기록 요약의 누락
더 많은 모델이 돕더라도 책임까지 대신하지는 않습니다
Stanford Medicine의 안전성 평가에서는 20개 AI 모델과 4,249개의 임상 관리 선택지를 살폈습니다. 서로 다른 모델의 답을 종합하는 방식은 단일 모델에 의존하는 방식보다 더 안전하고 견고한 조언을 내는 것으로 나타났습니다. 한 모델이 놓친 가능성을 다른 모델의 답과 대조할 여지가 있다는 뜻으로 읽을 수 있습니다.
그러나 여러 답이 비슷하다고 해서 곧바로 의료적 승인이나 확정 진단이 되는 것은 아닙니다. AI는 의료 지식을 빠르게 정리할 수 있어도 환자에게 설명하고, 상황에 맞춰 판단하며, 그 결정에 책임지는 의료진의 역할까지 제공하지는 못합니다. 모델의 성능을 평가하는 기준과 실제 의료 판단을 맡길 수 있는 기준은 구분해야 합니다.
진료 준비에는 활용하고, 판단은 의료진과 확인합니다
AI의 실용적인 역할은 진료를 대신하는 것보다 진료를 준비하는 데 있을 수 있습니다. 기존 진료 기록이나 검사 결과를 이해하기 쉬운 말로 풀어 보거나, 15분 남짓한 진료 시간에 맞춰 핵심 소견과 우선 확인할 질문을 네 줄 정도로 간결하게 정리하는 용도입니다. 이때 ’이게 옴인가요?’처럼 추측한 병명을 전제로 묻기보다 증상과 검사 결과를 중립적으로 전하고, 기록에 적힌 내용과 아직 확인되지 않은 생각을 구분하는 편이 협업의 오류를 줄이는 데 도움이 됩니다. 이미 떠올린 질환이 있다면 ’그 질환이 아니라고 가정하면 어떤 다른 설명이 가능하고, 어떤 객관적 징후를 살펴야 하는가’처럼 반대 방향으로 물어 모델을 반론 상대로 삼을 수도 있습니다. 같은 질문을 ChatGPT, Claude, Gemini처럼 서로 다른 모델 두세 개에 던져 답이 갈리는 지점을 비교하면 놓친 가능성이나 오류를 찾는 데 도움이 됩니다.
핵심은 단독 모델의 높은 점수를 무시하지 않되, 그 점수를 개인의 진단으로 곧장 옮기지 않는 것입니다. AI가 만든 설명이나 요약에서 누락된 정보는 없는지 살펴보고, 건강에 관한 판단과 중요한 결정은 원래 기록을 함께 확인할 수 있는 의료진과 상의해야 합니다.