본문 바로가기
IT 학습 아카이브/IT Tech

업무용 AI, 도입하면 정말 일이 줄어들까? 엔비디아·세일즈포스 발표로 본 현실

by passcode 2026. 9. 16. 12:31

AI가 고객 답변을 써주는 데는 몇 초면 충분하지만, 그 뒤의 담당자 배정과 기록 수정은 여전히 사람이 맡고 있지 않나요? 미국 시간 9월 15일 공개된 세일즈포스의 Koa는 이런 여러 단계의 기업 업무를 겨냥한 AI 모델입니다. 이번 발표를 통해 업무용 AI의 변화와, 도입 전에 따져야 할 비용·성능 기준을 살펴봅니다.

오늘 주목한 AI 뉴스: 세일즈포스와 엔비디아의 Koa

세일즈포스와 엔비디아는 드림포스 행사에서 고객관계관리, 즉 CRM 업무를 위한 추론 모델 Koa를 발표했습니다. 한국 시간 9월 16일 확인한 공식 발표에 따르면 엔비디아 Nemotron을 기반으로 기업 업무 시나리오를 학습시킨 모델입니다. CRM은 고객 정보, 영업 기회, 상담 이력 등을 관리하는 시스템을 뜻합니다.

회사 측은 고객 데이터를 학습에 사용하지 않고 합성 시나리오를 활용했다고 설명했습니다. 또한 자체 CRM 벤치마크에서 주요 모델과 견줄 만한 성능과 더 적은 오류를 보였다고 주장했습니다. 현재 일부 고객의 시범 도입 단계이며 미국 지역의 일반 제공은 2026년 겨울을 예상한다고 밝혔습니다. 따라서 지금 한국 기업이 모두 사용할 수 있는 완성형 서비스로 받아들여서는 안 됩니다. 세일즈포스 공식 발표

왜 이 발표를 볼까: 답변 이후에 남는 일이 많다

이 발표에서 제가 주목하는 것은 업무가 끝났다고 판단하는 기준입니다. 고객 문의에 자연스러운 문장을 만들어 내는 것과, 그 문의를 적절한 담당자에게 전달하고 처리 상태를 기록하는 것은 다릅니다. 전자는 답변의 품질을 확인하면 되지만 후자는 시스템 안에서 실제로 무엇이 바뀌었는지 검증해야 합니다.

가령 고객이 배송 주소 변경을 요청했다고 가정해 봅시다. 답변 초안만 쓰는 AI라면 변경 방법을 안내할 수 있습니다. 실제 업무를 맡는 AI라면 본인 확인, 주문 상태 조회, 변경 가능 여부 판단, 정보 수정, 결과 안내까지 연결해야 합니다. 이미 출고된 주문이라면 다른 절차가 필요합니다. 여기서는 말솜씨보다 업무 규칙과 예외를 이해하는 능력이 중요해집니다. 이는 이해를 돕기 위한 예시이며 Koa의 해당 기능을 직접 검증했다는 뜻은 아닙니다.

이런 관점에서 Koa 발표는 범용 AI에 회사 업무를 연결하는 방식 외에, 업무 자체에 특화한 모델을 선택하는 흐름을 보여주는 사례라고 봅니다. 다만 제품 하나의 발표로 산업 전체의 승자가 정해졌다고 말할 수는 없습니다. 실제 고객 환경에서 얼마나 안정적으로 작동하는지가 다음 판단의 근거가 돼야 합니다.

자체 벤치마크가 좋으면 우리 회사에서도 좋을까

회사 측 평가 결과는 출발점으로 볼 수 있지만 구매 결정을 대신하지는 못합니다. 시험에 쓰인 업무가 우리 회사의 업무와 비슷한지, 예외 상황이 얼마나 포함됐는지, 비교 모델의 설정이 같은지에 따라 숫자의 의미가 달라집니다. 이번 글에서는 독립 기관의 재현 결과나 국내 기업의 운영 성과까지 확인하지 못했습니다.

특히 오류 횟수만으로는 충분하지 않습니다. 약속 시간을 잘못 추천한 오류와 고객의 계약 금액을 잘못 수정한 오류는 같은 한 건이어도 피해가 다릅니다. 평균 성공률이 높더라도 큰 손실로 이어지는 실수가 남아 있다면 승인 단계를 유지해야 합니다. 반대로 낮은 위험의 업무에서 사람이 쉽게 고칠 수 있는 오류라면 충분한 생산성 개선을 얻을 수도 있습니다.

제가 실제 도입을 판단한다면 성공률과 함께 재작업 시간, 사람이 개입한 비율, 잘못 변경한 데이터의 복구 가능성을 보겠습니다. 답변 생성에 걸린 시간이 줄어도 검수 시간이 늘었다면 전체 효율은 개선되지 않았을 수 있습니다. 성능을 평가하는 단위는 한 번의 모델 응답보다 업무 한 건의 완료 과정에 가까워져야 합니다.

한국 직장인에게는 어떤 변화가 있을까

이번 발표만으로 영업직이나 상담직이 사라진다고 말하는 것은 지나친 해석입니다. 고객 응대에는 자료 조회와 기록처럼 반복적인 부분도 있고, 불만의 맥락을 파악하거나 예외를 조정하는 부분도 있습니다. 자동화 가능성은 직업 전체보다 업무 단위로 나누어 살피는 편이 정확합니다.

학습 방향도 여기에 맞출 수 있습니다. AI에게 문장을 잘 요청하는 능력과 함께, 업무의 시작 조건·필요 정보·완료 기준을 설명하는 연습이 유용합니다. 예를 들어 상담 기록 정리를 맡긴다면 필수 항목은 무엇인지, 누락된 정보는 어떻게 표시할지, 담당자가 확인해야 하는 상황은 무엇인지 정할 수 있어야 합니다. 이런 지식은 특정 모델을 바꾸더라도 남습니다.

한국 기업이라면 한국어의 자연스러움 외에도 국내 주소와 날짜 표기, 조직별 승인 절차, 자사 문서 용어를 따로 시험할 필요가 있습니다. 해외 사례에서 좋은 결과가 나왔다는 이유만으로 국내 업무에도 같은 효과가 난다고 가정해서는 안 됩니다. 특히 여러 시스템에 중복 저장된 고객 정보가 다를 때 무엇을 기준으로 삼을지부터 합의해야 합니다.

중소기업이 당장 전용 AI 모델을 만들어야 할까

저는 대부분의 작은 조직이 이번 뉴스를 보고 곧바로 자체 모델 학습에 나설 필요는 없다고 봅니다. 아직 업무 절차가 문서화되지 않았거나 데이터가 정리되지 않았다면 모델을 바꾸어도 문제가 남습니다. 먼저 자주 반복되고 처리 기준이 분명한 업무 하나를 골라 기존 도구로 실험하는 편이 현실적입니다.

예를 들어 문의를 분류하고 답변 초안을 만드는 단계부터 시작해 담당자가 결과를 검토하도록 할 수 있습니다. 이 과정에서 어떤 유형의 문의에 자주 실패하는지 기록하면 다음 개선 방향이 보입니다. 실패 원인이 최신 정보 부족이라면 문서 검색을 개선해야 하고, 승인 규칙이 모호하다면 운영 절차를 정리해야 합니다. 모든 문제를 모델의 지능 부족으로 설명하면 비용만 늘기 쉽습니다.

전용 모델이 유리할 가능성은 있습니다. 반복량이 많고 업무 용어가 특수하며, 일반 도구로는 원하는 품질이나 운영 조건을 맞추기 어려운 경우입니다. 다만 그때도 외부 서비스 이용료와 자체 운영비, 업데이트 비용, 담당 인력의 시간을 같은 기준으로 비교해야 합니다. 개발할 수 있다는 사실만으로 직접 운영하는 것이 경제적이라고 결론 내릴 수는 없습니다.

도입 전에 확인할 다섯 가지 질문

  • 어떤 업무가 끝나는가? 요약이나 추천인지, 실제 시스템 변경까지 수행하는지 범위를 적습니다.
  • 현재 비용은 얼마인가? 기존 처리 시간과 재작업 시간을 기록해 비교 기준을 만듭니다.
  • 어떤 오류가 가장 비싼가? 피해가 큰 변경에는 검토와 복구 절차를 둡니다.
  • 우리 데이터로도 작동하는가? 개인정보를 적절히 보호한 대표 사례와 예외 사례로 확인합니다.
  • 그만 쓸 수 있는가? 결과와 기록을 내보낼 수 있는지, 다른 도구로 바꿀 때 비용이 얼마나 드는지 살핍니다.

앞으로 확인할 것은 고객 현장의 결과다

업무 특화 AI가 언제나 범용 AI보다 유리하다고 단정할 수는 없습니다. 회사의 프로세스가 자주 바뀌거나 다루는 업무가 넓다면 범용 도구의 유연성이 더 중요할 수 있습니다. 특정 업무에 맞춘 평가에서 높은 점수를 얻는 것과, 계속 변하는 조직의 요구에 적응하는 것은 다른 문제입니다.

제 판단이 더 긍정적으로 바뀔 근거는 분명합니다. 다양한 고객 환경에서 오류의 심각도와 총비용이 줄었다는 결과, 사람이 검수하는 시간을 포함해도 효율이 개선됐다는 자료, 한국어와 국내 업무에 대한 검증이 쌓이는 경우입니다. 반대로 운영 부담과 수정 비용이 절감 효과보다 크다면 도입 범위를 줄이는 것이 맞습니다.

오늘 발표의 의미는 회사 업무를 실제로 처리하는 AI를 놓고 경쟁이 구체화되고 있다는 데 있습니다. 다만 신제품 발표와 생산성 개선 사이에는 현장 검증이라는 과정이 남아 있습니다. 기업은 작은 업무부터 효과를 재고, 직장인은 자신의 일을 명확하게 설명하고 결과를 검토하는 능력을 키우면 됩니다. AI를 도입했다는 사실보다 일이 얼마나 정확하고 편해졌는지가 결국 남는 성과입니다.

참고 자료
Salesforce·NVIDIA Koa 공식 발표 — 2026.9.15
Dreamforce 2026 공식 뉴스 자료

2026년 9월 16일 한국 시간 기준. 제품 관련 사실은 공급사의 공식 발표에 근거하며, 도입 판단과 업무 예시는 필자의 분석입니다. 조회수 순위나 검색량으로 ‘최고 인기’를 확인한 글은 아닙니다.