비즈니스 AI 에이전트는 익숙한 이야기의 현재 판본입니다. 십 분 만에 훌륭하게 돌아가는 데모가 있고, 그다음 그것을 사람이 지켜보지 않아도 될 만큼 믿을 수 있게 만들려는 여섯 달이 이어집니다. 이 두 상태 사이가 예산이 거의 전부 사라지는 곳이고, 그 간극을 설명하는 마케팅 자료는 거의 없습니다.
에이전트는 상업적으로 중요한 한 가지 점에서 챗봇과 다릅니다. 챗봇은 글을 만들고 사람이 그것으로 무엇을 할지 정합니다. 에이전트는 스스로 행동합니다. 시스템을 호출하고, 레코드를 쓰고, 메시지를 보냅니다. 그 차이가 위험을 민망함에서 결과로 옮기고, 그래서 필요한 엔지니어링 규율은 콘텐츠 도구보다 결제 시스템을 만드는 쪽에 가깝습니다.
돈이 실제로 가는 곳: 모델이 가장 싼 부분입니다. 비용은 도구 연동, 평가 장치, 가드레일, 그리고 사람에게 넘기는 경로에 있습니다. 단순한 내부 에이전트는 £5,000에서 £12,000, 검색을 갖춘 것은 £12,000에서 £30,000, 실제 시스템 접근 권한을 가진 다단계 에이전트는 약 £30,000에서 시작해 모니터링과 되돌리기를 제대로 만들면 £75,000 이상에 이릅니다.
비즈니스 AI 에이전트가 실제로 통하는 곳
구체적으로 말할 가치가 있습니다. 정직한 목록은 과장보다 짧고 더 쓸모 있기 때문입니다.
에이전트는 반복적이고 경계가 분명하며 검토 단계를 견디는 업무에서 잘합니다. 들어오는 문의를 분류하고 초안 답변을 붙여 넘기기. 비정형 문서에서 구조화된 데이터를 뽑되 확정 전에 사람이 확인하기. 두 시스템 사이 레코드를 대사하고 예외를 해결하는 대신 표시하기. 흔한 건은 처리하고 나머지는 깔끔하게 넘기는 일차 응대.
패턴은 에이전트가 물량을 맡고 사람이 판단을 맡는 것입니다. 저희가 운영에서 작동하는 것을 본 모든 배치가 이 모양이었고, 실패한 대부분은 판단이 실제로 필요한 절차에서 사람을 완전히 빼려는 시도였습니다.
실수가 비싸고 발견하기 어려운 곳, 필요한 지식이 누군가의 머릿속에만 있는 곳, 절차가 매번 진짜로 다른 곳에서는 잘 못합니다. 안정된 구조가 없는 일을 맡은 에이전트는 한 번도 맞히지 못한 채 그럴듯한 출력을 끝없이 내놓고, 이는 눈에 보이게 실패하는 것보다 나쁩니다.
파일럿이 데모와 운영 사이에서 멈추는 이유
첫 번째 실패 양상은 산수이고 사람들을 놀라게 합니다. 에이전트 체인의 한 단계가 95퍼센트 신뢰도라면, 다섯 단계 작업은 약 77퍼센트, 열 단계 작업은 약 60퍼센트만 성공합니다. 데모에서는 아무도 눈치채지 못합니다. 데모는 순탄한 경로를 지나기 때문입니다. 파일럿 3주 차에 분명해지고, 그때의 해법은 프롬프트 수정이 아니라 설계입니다. 체인을 짧게 하고, 단계 사이에 검증을 넣고, 실패가 아래로 전달되지 않고 감지되도록 각 단계를 설계하세요.
두 번째는 대부분의 업무 절차에 되돌리기가 없다는 점입니다. 잘못된 이메일을 보낸 에이전트는 그것을 회수하지 못합니다. 고객 레코드를 갱신한 에이전트는 다른 시스템이 이미 읽은 것을 바꿔놓았습니다. 어떤 동작을 되돌릴 수 있게 만드는 일은 흔히 그 동작 자체보다 더 많은 작업이고, 미뤄졌다가 발견되는 바로 그 부분입니다.
평가가 진짜 엔지니어링 비용입니다
세 번째 실패는 평가이고, 여기에 진짜 엔지니어링 노력이 있으며 이 분야에 처음인 팀은 일관되게 과소평가합니다. 기존 소프트웨어는 기대 출력과 대조해 시험합니다. 에이전트는 실행할 때마다 다른 출력을 내고 여러 형태로 옳을 수 있으므로, 허용 가능한 동작의 기준을 정한 현실적인 사례 묶음을 등급화해 두고 변경마다 자동으로 돌려야 합니다. 그것이 없으면 프롬프트 조정이 나아지게 한 것인지, 보지 않는 곳으로 결함을 옮긴 것인지 알 수 없습니다. 평가 장치를 만드는 데 에이전트 본체만큼의 시간이 든다고 보십시오.
네 번째는 비용 변동입니다. 토큰 소비는 재시도와 체인 길이에 비례하므로, 실패하는 에이전트가 잘 도는 에이전트보다 비싸고, 루프에 빠진 에이전트는 훨씬 더 비쌉니다. 평균적 동작이 전형적이라고 가정한 예산은 대개 나쁜 쪽으로 틀립니다. 언어 모델의 지연과 비용 에 관한 안내가 이를 묶어두는 캐싱과 라우팅 전략을 다룹니다.
지금 적용되는 고지 의무
최근에 바뀐 부분이고, 고객 대면 에이전트를 만드는 기업 대부분이 인지하지 못한 대목입니다.
EU AI법 제50조의 투명성 의무는 당초 일정대로 2026년 8월 2일 발효했습니다. 사람이 AI 시스템과 상호작용하고 있다는 고지, AI가 생성한 합성 음성과 이미지, 영상, 텍스트의 표시, 그리고 딥페이크 공개를 요구합니다. 핵심은 위험 등급이 아니라 시스템이 무엇을 하는지에 따라 적용된다는 점이고, 따라서 평범한 고객 응대 에이전트도 대상입니다.
고위험 의무는 연기됐습니다. EU의 AI 디지털 옴니버스, 규정 2026/1744 은 2026년 7월 24일 관보에 게재되어 원래 기한 엿새 전인 2026년 7월 27일 발효했습니다. 부속서 III의 독립형 고위험 시스템 준수 시한을 2026년 8월 2일에서 2027년 12월 2일로, EU 제품안전법이 이미 적용되는 제품에 내장된 AI는 2028년 8월 2일로 옮겼습니다. 옴니버스는 제5조에 금지 범주 두 가지를 더했고, 관련 기술적 안전장치에는 2026년 12월 2일까지 유예를 뒀습니다.
AI Act Explorer 는 특정 시스템에 어떤 조문이 닿는지 확인하는 가장 빠른 방법입니다. 영국은 이에 상응하는 법을 제정하지 않았고 규제기관 주도 접근을 이어가므로, 순수한 국내 배치는 전용 AI 체계가 아니라 기존 법의 적용을 받습니다. 이 구분은 들리는 것보다 덜 중요합니다. EU 고객을 상대하거나 제품이 EU에서 쓰인다면, 어디에 법인이 있든 이 법은 여러분에게 미치고, 투명성 의무는 연기가 아니라 지금 효력이 있습니다. 고객 대면 에이전트에 고지를 넣는 일은 설계 시점에는 싸고 나중에 덧붙이기는 껄끄럽습니다.
비용
아래 구간은 더 넓은 AI 도입 비용 가이드 와 같은 구조를 따르며, 운영비가 아니라 구축비를 나타냅니다.
한두 개 시스템을 상대로 하나의 경계 지어진 업무를 하고 사람이 출력을 검토하는 내부 에이전트는 £5,000에서 £12,000입니다. 이것이 올바른 첫 프로젝트이고, 여기서 데이터와 절차가 쓸 만한 상태인지 알게 됩니다.
자체 문서에 대한 검색을 갖추고 여러 도구로 실제 업무 절차를 처리하는 에이전트는 £12,000에서 £30,000입니다. 보통 검색 계층이 더 큰 부분을 차지하는데, 품질의 상한을 모델이 아니라 문서 구조가 정하기 때문입니다. 파인튜닝과 검색, 프롬프팅 비교가 어떤 접근이 어떤 문제에 맞는지 다룹니다.
운영 시스템에 쓰기 권한을 갖고, 제대로 된 모니터링과 되돌리기, 평가 장치를 갖춘 다단계 에이전트는 약 £30,000에서 시작해 흔히 £75,000 이상에 이릅니다. 그 금액을 만드는 것은 기능이 아닙니다. 안전 장치입니다.
운영 비용은 별개이고 공급업체가 시사하는 것보다 변동이 큽니다. 모델 호출, 검색 인프라, 모니터링, 그리고 발밑에서 모델이 바뀌는 동안 평가를 유지하는 엔지니어링 시간입니다. 마지막 항목은 명시적으로 예산에 넣으세요. 모델 공급자는 자기 일정에 따라 중단하고 개정하며, 그때마다 에이전트의 동작이 달라집니다.
첫 프로젝트 범위를 잡는 법
지금의 성능을 이미 측정할 수 있는 업무를 고르세요. 수작업이 얼마나 걸리는지, 얼마나 자주 틀리는지 모른다면 에이전트가 도움이 됐는지 말할 수 없고, 프로젝트는 인상으로 평가됩니다.
첫 체인은 짧게 유지하세요. 작동하는 세 단계가 대체로 작동하는 열 단계보다 나은 기반이고, 데이터 품질에 대해 같은 교훈을 줍니다.
평가 세트를 에이전트보다 먼저 만드세요. 좋은 결과가 알려진 실제 사례 스무 건에서 쉰 건을, 누구도 프롬프트를 쓰기 전에 문서로 남기세요. 이 한 가지 관행이 수렴하는 프로젝트와 흔들리는 프로젝트를 가릅니다.
인계를 명시적으로 설계하세요. 에이전트가 확신하지 못할 때 무슨 일이 일어나는지, 사람은 무엇을 보는지, 그 건이 어떻게 대기열로 돌아오는지. 이를 예외로 취급하는 팀은 그것이 흥미로운 트래픽의 대부분임을 알게 됩니다.
첫날부터 모든 것을 계측하세요. 실행마다 전체 입력과 추론, 호출된 도구, 결과가 필요합니다. 이해해야 할 실패는 예상하지 못한 것들이기 때문입니다.
만들지 말아야 할 때
자동화하려는 절차가 안정적이고 규칙 기반이라면, 기존 소프트웨어가 더 싸고 빠르고 믿을 만하며 감사하기 쉽습니다. 지금 에이전트로 만들어지는 것의 상당수는 조건 몇 개를 붙인 예약 작업이면 충분하고, 그편이 더 낫습니다.
데이터가 흩어져 있거나 일관성이 없거나 문서화돼 있지 않다면 그것부터 고치세요. 에이전트는 기반 데이터의 모든 문제를 물려받아 증폭합니다. 잘못된 입력에도 멈추지 않고 자신 있게 행동하기 때문입니다.
에이전트에 무엇이든 쓰기 권한을 주기 전에 대규모 언어 모델 애플리케이션을 위한 OWASP 상위 10선 을 읽어볼 가치가 있습니다. 모델이 답하는 데 그치지 않고 행동할 수 있게 된 순간부터 중요해지는 실패 유형을 정리해 둔 자료입니다. 그리고 잘못했을 때 무슨 일이 벌어지느냐는 물음에 대한 정직한 답이 일주일간 아무도 모른다는 것이라면, 쓰기 권한을 주지 마세요. 사람 승인을 위해 초안을 만드는 읽기 전용 에이전트가 위험의 일부만으로 가치의 대부분을 가져가고, 실제 부하를 견디는 쪽도 그 형태입니다.
현실적인 범위 잡기
이런 프로젝트가 가장 흔히 틀어지는 방식은, 아래의 데이터와 절차가 그것을 떠받칠 수 있는지 확인하기 전에 야심 찬 에이전트에 발을 담그는 것입니다. 짧은 사전 조사가 싸게 답해주는 질문입니다.
Mecanik은 AI 통합 서비스 를 통해 운영용 에이전트를 만들며, 평가 장치와 모니터링, 되돌리기를 부가가 아니라 산출물로 다루고, 주변 애플리케이션 작업은 소프트웨어 개발 팀이 맡습니다. 데모는 잘 되는데 안정되지 않는 파일럿이 있다면, 그것은 구체적이고 고칠 수 있는 문제이며 이야기해볼 가치가 있습니다.
관련 게시물: 영국 헬스케어 소프트웨어: 규제와 비용 , Kimi K3 자체 호스팅: 하드웨어, 비용, 데이터 주권 , 서드파티 API 연동: 비용과 실패 유형 , OpenAI API 통합: 기존 앱에 GPT 추가하기 .
자주 묻는 질문
AI 에이전트와 챗봇은 무엇이 다른가요? 챗봇은 사람이 활용할 글을 만듭니다. 에이전트는 스스로 행동해 시스템을 호출하고 레코드를 쓰고 메시지를 보냅니다. 그 차이가 위험을 민망함에서 결과로 옮기므로, 필요한 엔지니어링 규율은 콘텐츠 도구보다 결제 시스템에 가깝습니다.
AI 에이전트는 기업에 비용이 얼마나 드나요? 경계가 분명한 업무를 사람 검토와 함께 처리하는 내부 에이전트는 £5,000에서 £12,000입니다. 자체 문서 검색과 여러 도구를 갖춘 것은 £12,000에서 £30,000입니다. 운영 시스템 쓰기 권한과 모니터링, 되돌리기를 갖춘 다단계 에이전트는 약 £30,000에서 시작해 흔히 £75,000를 넘습니다.
AI 에이전트 파일럿이 운영까지 가지 못하는 이유는? 신뢰도는 단계를 거칠수록 나쁘게 곱해집니다. 각 단계가 95퍼센트인 다섯 단계 체인도 성공률은 약 77퍼센트입니다. 대부분의 업무 절차에는 되돌리기도 없고, 평가 장치를 만드는 데 보통 에이전트 본체만큼의 시간이 듭니다.
고객이 AI와 대화 중임을 고지해야 하나요? EU AI법에 따라 제50조 투명성 의무가 2026년 8월 2일 발효했고, 사람이 AI 시스템과 상호작용할 때의 고지와 생성 콘텐츠 표시를 요구합니다. 위험 등급이 아니라 시스템이 무엇을 하는지에 따라 적용되며, EU 고객을 상대하는 기업에는 법인 소재지와 무관하게 미칩니다.
EU AI법의 고위험 규정은 연기됐나요? 네. 규정 2026/1744, AI 디지털 옴니버스가 2026년 7월 27일 발효해 부속서 III의 독립형 고위험 시스템 의무를 2026년 8월 2일에서 2027년 12월 2일로, 규제 대상 제품에 내장된 AI는 2028년 8월 2일로 옮겼습니다. 제50조 투명성 의무는 연기되지 않았습니다.
댓글