기업용 AI agent(기업 업무를 자율적으로 수행하는 AI 시스템)를 도입할 때 좋은 모델을 고르는 것만으로는 부족합니다. Salesforce 사장 겸 최고 플랫폼·엔지니어링 책임자인 Rohan Kumar는 agent가 맡을 업무의 맥락을 이해하면서도, 시험을 거치고 필요한 데이터에만 접근하도록 운영하는 일이 중요하다고 봅니다. 데이터가 많다는 사실과 업무를 제대로 판단할 수 있다는 사실은 다릅니다.
데이터에는 결과가 남아도 이유는 남지 않습니다
기업용 agent의 능력은 크게 세 부분에서 나옵니다. agent 코드가 무엇을 할 수 있는지 정하고, 기반 모델이 일반적인 추론 능력을 제공하며, 기업의 업무 맥락이 그 조직에서는 어떻게 판단해야 하는지를 알려줍니다. 이 가운데 가장 확보하기 어려운 것은 마지막 부분입니다.
직원이 관리자에게 규정의 예외를 승인받는 상황을 생각해 볼 수 있습니다. 시스템에는 승인 결과가 저장되더라도, 왜 예외를 허용했는지에 관한 사정과 판단은 기록되지 않을 수 있습니다. 회의나 대화에서 이뤄진 다른 결정도 마찬가지입니다. agent가 참고할 수 있는 기록에 결과만 있다면, 비슷해 보이지만 조건이 다른 다음 업무에서 판단 근거를 찾기 어렵습니다.
따라서 업무 맥락을 제공한다는 것은 파일을 더 많이 연결하는 일에 그치지 않습니다. 현업 담당자와 엔지니어가 실제 결정 과정을 함께 살피고, 예외가 생기는 조건과 판단 이유를 agent가 사용할 수 있는 형태로 정리해야 합니다. 이는 모델의 일반 지식을 해당 기업의 업무 방식과 연결하는 작업입니다.

▲ 기록되지 않은 판단 이유
시험·등록·권한은 실행 환경의 일부입니다
agent를 작성하고 실행한 뒤 시험하는 기본 절차에는 신뢰할 수 있는 평가 질문과 기대 답변을 모은 golden set(평가용 기준 문항과 답변 묶음)이 쓰일 수 있습니다. 하지만 한 번의 시험만으로 기업 전체에서 운영 중인 agent를 관리할 수는 없습니다. 어떤 agent가 작동하는지 파악하고, 필요하면 비활성화할 수 있는 중앙 등록 체계도 필요합니다.
특히 agent가 업무를 요청한 직원의 권한을 그대로 물려받는 방식은 주의해야 합니다. agent가 예상과 다르게 작동하면 원래 맡은 일과 관계없는 기밀 데이터에도 접근할 수 있기 때문입니다. Kumar가 제안하는 대안은 agent마다 별도의 신원을 부여하고, 해당 업무에 필요한 권한으로 범위를 제한하는 것입니다. 시험이 agent의 행동을 점검한다면, 권한 제한은 예상 밖의 행동이 영향을 미칠 수 있는 범위를 줄입니다.
데이터 접근 정책도 같은 체계에 속합니다. 공개 정보, 내부 정보, 기밀 정보를 구분하지 못한 채 저장소를 연결하면 agent가 무엇을 읽어도 되는지 판단하기 어렵습니다. 모델을 선택하기 전에 어떤 agent가 어떤 목적으로 어떤 데이터에 접근할지부터 정해야 합니다.
모든 데이터를 한꺼번에 넣는 것은 해법이 아닙니다
여러 데이터 저장소와 업무 서비스를 연결해 원본 내용을 한꺼번에 모델에 전달하면, 관련 없는 정보까지 처리하게 됩니다. 이는 token(모델이 처리하는 텍스트 단위) 사용량을 늘려 비용을 키우면서도 답의 신뢰성을 보장하지 못하는 방식입니다. 민감한 데이터의 취급 범위도 더 신중하게 관리해야 합니다.
Kumar는 그 대신 사용량이 낮은 시간에 데이터를 미리 정리하는 방법을 제안합니다. 예를 들어 밤 11시부터 새벽 5시 사이에 서로 다른 저장소의 자료를 분류하고, 업무 개념과 관계를 정리해 agent가 활용할 맥락을 준비합니다. 흩어진 정보를 knowledge graph(대상과 대상 사이의 관계를 연결해 나타낸 구조)로 구성하면 고객, 고객의 사안, 적용되는 정책처럼 서로 관련된 항목을 따라 필요한 정보를 찾을 수 있습니다. 핵심은 질문이 들어올 때마다 모든 원본을 읽히는 대신, 미리 정리한 맥락에서 필요한 부분을 제공하는 것입니다.

▲ 정리된 업무 맥락
모델 선택에도 같은 원칙이 적용됩니다. model routing(업무에 맞춰 사용할 모델을 고르는 방식)을 통해 업무별로 요구되는 성능과 비용을 함께 따져야 합니다. 단순한 작업까지 가장 비싼 모델에 일괄 배정할 이유는 없습니다. 성능 향상이 실제 업무에 도움이 되는지 확인하고, 그렇지 않다면 더 가벼운 모델을 선택하는 방식입니다.
도입 전에 결정의 이유와 접근 범위를 확인합니다
기업용 agent의 과제는 모델 성능 하나로 환원되지 않습니다. 업무 판단의 근거를 기록하고, 그 근거를 안전하게 제공하며, agent의 행동과 비용을 계속 관리해야 합니다. 도입을 준비한다면 다음 항목부터 점검할 수 있습니다.
- 업무 맥락: 예외 승인이나 주요 결정에서 결과뿐 아니라 이유도 남는지 확인합니다. 현업 담당자와 엔지니어가 함께 실제 판단 과정을 살펴봅니다.
- 시험과 권한: 기준 질문과 기대 답변으로 agent를 시험하고, 운영 중인 agent를 등록·관리합니다. 직원의 전체 권한을 물려주는 대신 업무별 접근 범위를 정합니다.
- 데이터와 비용: 데이터의 민감도를 구분하고 필요한 맥락을 미리 정리합니다. 업무별 성능 요구와 token 비용을 고려해 사용할 모델을 선택합니다.
이 순서는 agent에게 무엇을 맡길 수 있는지 판단하는 출발점이 될 수 있습니다. 우선 한 업무에서 ‘무엇을 결정했는가’뿐 아니라 ‘왜 그렇게 결정했는가’가 기록되는지 확인하는 것이 좋습니다.