“매주 월요일 아침 시장 동향을 정리해줘.”
지금까지의 AI는 이 요청에 답을 한 번 만들어주는 데 가까웠습니다. 다음 주 월요일에도 같은 작업을 원한다면, 다시 대화를 열고 같은 지시를 반복해야 했습니다. 하지만 OpenAI가 공개한 상시형 AI 에이전트 ‘dots’는 이 경험을 바꾸려 합니다. 사용자가 대화를 닫은 뒤에도, AI가 목표를 기억하고 필요한 작업을 계속 추적·수행하는 방식입니다.
공개된 설명에 따르면 dots는 GPT-6 Astra를 기반으로 작동하며, 단순한 챗봇이 아니라 장기 목표를 관리하는 지속형 에이전트에 가깝습니다. 예를 들어 시장 동향 리포트를 맡기면 관련 뉴스와 산업 데이터를 모니터링하고, 중요한 변화가 발생했을 때 요약을 준비하며, 정해진 시점에 보고서를 전달하는 흐름을 상상할 수 있습니다.
기존 AI와의 가장 큰 차이는 세션이 끝나도 업무가 끝나지 않는다는 점입니다. 사용자의 목표, 진행 상태, 이전 작업 결과를 유지하면서 다음 행동을 계획합니다. 이를 위해 에이전트는 보통 다음과 같은 구조로 움직입니다.
- 목표 관리: “매주 시장 동향 정리”처럼 장기적인 요청을 저장하고 우선순위를 설정합니다.
- 계획 수립: 목표를 데이터 수집, 변화 감지, 핵심 이슈 분류, 보고서 작성 같은 하위 작업으로 나눕니다.
- 도구 및 앱 연동: 문서, 이메일, 메신저, CRM, 캘린더 등 여러 서비스에서 필요한 정보를 찾고 작업을 이어갑니다.
- 상태 기억: 지난주 보고서의 핵심 내용과 사용자의 피드백을 반영해 다음 결과물을 개선합니다.
- 예외 처리: 중요한 변화나 권한이 필요한 작업이 생기면 사용자에게 확인을 요청할 수 있습니다.
이런 테크 변화가 현실화되면 AI는 더 이상 “질문에 답하는 도구”에 머물지 않습니다. 리서치 담당자, 운영 보조자, 개발 프로젝트 감시자처럼 특정 목표를 맡아 계속 일하는 디지털 업무 파트너로 진화하게 됩니다.
다만 상시 동작이라는 장점은 동시에 새로운 책임을 요구합니다. 여러 앱과 데이터를 넘나드는 에이전트일수록 접근 권한, 개인정보, 잘못된 자동 실행을 엄격하게 관리해야 합니다. 따라서 dots 같은 에이전트의 가치는 얼마나 많은 일을 자동화하느냐뿐 아니라, 사용자가 무엇을 맡기고 어디까지 통제할 수 있느냐에 달려 있습니다.
테크 상시 에이전트의 엔진: 기억하고, 계획하고, 실행하는 구조
사용자가 자리를 비운 동안에도 AI가 일을 계속하려면 무엇이 필요할까요? 답은 단순히 “더 똑똑한 모델”이 아닙니다. 목표를 잊지 않고, 진행 상황을 기록하며, 적절한 도구를 선택해 실행하는 시스템 전체가 필요합니다.
OpenAI의 dots처럼 항상 켜져 있는 에이전트는 대화 한 번에 답을 생성하는 기존 챗봇과 다릅니다. 사용자의 장기 목표를 유지하고, 여러 애플리케이션을 오가며, 필요한 순간에 다음 행동을 결정해야 합니다. 이 구조는 크게 기억, 계획, 실행, 통제의 네 층으로 이해할 수 있습니다.
목표와 상태를 보존하는 지속형 메모리
일반적인 챗봇은 대화가 끝나면 작업의 맥락도 끊기기 쉽습니다. 반면 상시 에이전트는 “다음 주까지 경쟁사 동향을 조사해 보고서를 작성하라”는 목표를 며칠 동안 유지해야 합니다.
이를 위해서는 단순한 채팅 기록이 아니라, 작업에 필요한 정보를 구조적으로 저장하는 지속형 메모리가 필요합니다.
- 장기 목표: 사용자가 궁극적으로 원하는 결과물
- 작업 상태: 현재 완료된 단계와 남은 단계
- 사용자 선호: 보고서 형식, 승인 방식, 우선순위
- 업무 맥락: 연결된 문서, 일정, 프로젝트, 담당자 정보
- 실행 이력: 어떤 도구를 언제 사용했고 어떤 결과가 나왔는지
예를 들어 에이전트가 시장 리서치 업무를 맡았다면, 단순히 뉴스를 요약하는 데서 끝나지 않습니다. 이미 확인한 자료와 미확인 자료를 구분하고, 이전 보고서의 관점과 사용자의 피드백까지 반영해야 합니다. 그래야 매번 처음부터 다시 조사하는 대신, 시간이 지날수록 더 일관된 결과를 낼 수 있습니다.
GPT-6 Astra가 맡는 역할: 계획을 세우는 두뇌
공개된 설명에 따르면 dots는 GPT-6 Astra를 기반으로 동작합니다. 세부 아키텍처가 모두 알려진 것은 아니지만, 이런 모델은 에이전트의 핵심 두뇌로서 추론·계획·도구 선택을 담당할 가능성이 큽니다.
에이전트는 사용자의 추상적인 지시를 그대로 실행할 수 없습니다. 먼저 목표를 작고 검증 가능한 작업으로 나눠야 합니다.
“신규 고객 이탈 원인을 분석하고 대응안을 준비해 줘.”
이 요청은 다음과 같은 작업 흐름으로 분해될 수 있습니다.
- CRM에서 최근 이탈 고객 데이터를 수집합니다.
- 고객 세그먼트와 이용 패턴을 분석합니다.
- 고객 문의·설문·지원 티켓에서 공통 불만을 찾습니다.
- 원인별 우선순위를 정합니다.
- 대응 캠페인과 제품 개선안을 제안합니다.
- 필요한 경우 담당자에게 검토를 요청합니다.
이 과정에서 모델은 단순 답변 생성기가 아니라 플래너로 작동합니다. 목표를 해석하고, 작업 순서를 정하고, 중간 결과에 따라 계획을 수정하는 역할입니다. 이것이 상시 에이전트가 기존 자동화 도구보다 더 유연해질 수 있는 이유입니다.
여러 앱을 연결하는 실행 계층
계획만으로 업무는 완료되지 않습니다. 실제 결과를 만들려면 이메일, 문서 도구, CRM, 데이터베이스, 협업 메신저 등 외부 시스템을 사용해야 합니다.
따라서 상시 에이전트에는 모델의 판단을 실제 행동으로 바꾸는 실행 계층이 필요합니다. 이 계층은 보통 API, 커넥터, 브라우저 자동화, 사내 도구 연동 등을 통해 구성됩니다.
에이전트가 수행할 수 있는 행동은 다음과 같습니다.
- 문서 시스템에서 최신 정책 파일 검색
- 스프레드시트에서 수치 집계 및 분석
- CRM에서 특정 조건의 고객 목록 조회
- 슬랙이나 이메일로 담당자에게 검토 요청
- 일정 도구에 회의 초안 생성
- 개발 저장소에서 오류 로그와 변경 이력 확인
중요한 점은 에이전트가 모든 도구를 무제한으로 쓰는 것이 아니라는 사실입니다. 어떤 도구를 언제 호출할지, 결과가 충분한지, 다음 행동으로 넘어가도 되는지를 판단하는 오케스트레이션이 필요합니다. 이 크로스 애플리케이션 조율 능력이 앞으로 테크 업계의 에이전트 경쟁력을 가를 핵심 요소가 될 수 있습니다.
실행 결과를 검증하고 계획을 수정하는 피드백 루프
현실의 업무는 한 번의 계획대로 흘러가지 않습니다. 데이터가 누락될 수도 있고, 권한이 없을 수도 있으며, 외부 시스템의 응답이 늦어질 수도 있습니다. 좋은 에이전트는 실패를 단순 중단으로 처리하지 않고, 결과를 평가한 뒤 다음 행동을 다시 설계해야 합니다.
이 과정을 간단히 표현하면 다음과 같습니다.
목표 설정 → 작업 계획 → 도구 실행 → 결과 확인 → 계획 수정 → 완료 또는 승인 요청
가령 보고서 작성에 필요한 데이터가 부족하다면, 에이전트는 임의로 결론을 내리기보다 추가 자료를 찾거나 사용자에게 판단을 요청해야 합니다. 또한 중요한 변경 사항을 실행하기 전에는 “초안을 만들었으니 발송 전에 검토해 달라”는 식의 승인 단계를 두는 편이 안전합니다.
자율성의 조건은 권한 관리와 관제다
상시 에이전트가 강력해질수록 보안과 통제는 선택이 아니라 기본 기능이 됩니다. 장기간 실행되는 에이전트가 이메일, 문서, 고객 정보, 배포 시스템에 접근한다면 작은 오류도 큰 문제로 이어질 수 있기 때문입니다.
기업 환경에서는 특히 다음 기준이 중요합니다.
- 최소 권한 원칙: 업무에 필요한 범위에서만 데이터와 도구 접근 허용
- 승인 단계 설정: 결제, 외부 발송, 데이터 삭제 등 고위험 행동은 사람의 확인 필요
- 실행 로그 기록: 무엇을 조회하고 변경했는지 감사 가능한 형태로 저장
- 정책 기반 차단: 민감정보 전송, 권한 상승, 허용되지 않은 도구 사용 제한
- 이상 행동 탐지: 반복 실행, 비정상적 데이터 접근, 예상 밖의 작업 흐름 감시
결국 dots와 같은 상시 에이전트의 가치는 모델 하나의 성능만으로 결정되지 않습니다. 사용자의 목표를 오래 기억하는 메모리, 작업을 쪼개는 계획 능력, 앱을 넘나드는 실행력, 그리고 행동을 제한하고 검증하는 거버넌스가 함께 맞물려야 합니다.
에이전트 시대의 핵심 질문은 이제 “AI가 무엇을 답할 수 있는가”가 아닙니다. AI가 얼마나 안전하고 지속적으로 일을 완수할 수 있는가로 옮겨가고 있습니다.
테크: 모델 경쟁을 넘어 ‘일을 끝내는 AI’ 경쟁으로
AI 경쟁의 승자는 가장 큰 모델을 만든 기업일까요? 아니면 사용자의 실제 업무를 끝까지 처리해 주는 제품을 만든 기업일까요?
OpenAI의 항상 켜져 있는 AI 에이전트 dots가 던지는 질문은 분명합니다. 이제 테크 업계의 경쟁은 단순히 “더 똑똑한 모델”을 공개하는 데서 멈추지 않습니다. 사용자의 목표를 이해하고, 여러 도구를 연결하며, 긴 시간 동안 업무를 완수하는 에이전트 경험이 새로운 승부처가 되고 있습니다.
기존 생성형 AI는 대화 단위로 작동했습니다. 사용자가 질문하면 답하고, 문서를 요청하면 초안을 작성하는 방식입니다. 반면 dots와 같은 상시형 에이전트는 목표 자체를 지속적으로 관리하는 방향을 지향합니다. 예를 들어 “매주 경쟁사 동향을 분석해 보고서를 작성해 달라”는 요청을 받으면, 단순 요약을 한 번 제공하는 것이 아니라 뉴스와 시장 데이터를 계속 추적하고, 필요한 정보를 정리하며, 정해진 시점에 결과물을 제출하는 흐름입니다.
이 차이는 기술적으로도 작지 않습니다. 일을 끝내는 AI는 모델의 언어 능력 외에도 다음 역량을 함께 갖춰야 합니다.
- 장기 메모리와 상태 관리: 이전에 무엇을 했는지, 현재 업무가 어디까지 진행됐는지 기억해야 합니다.
- 계획 수립과 재계획: 큰 목표를 세부 작업으로 나누고, 실패나 변수 발생 시 실행 순서를 다시 설계해야 합니다.
- 도구·앱 연동: 이메일, 문서, CRM, 일정, 코드 저장소 등 여러 서비스의 API를 안전하게 호출해야 합니다.
- 권한과 승인 관리: 중요한 메일 발송, 결제, 데이터 수정처럼 위험한 행동은 사용자 승인과 정책 검증을 거쳐야 합니다.
- 결과 검증: 작업을 수행하는 데서 끝나지 않고, 결과가 목표와 조건에 맞는지 확인해야 합니다.
결국 모델 성능은 출발점일 뿐입니다. 실제 제품 경쟁력은 모델 위에 구축되는 오케스트레이션 계층, 앱 생태계, 사용자 경험, 보안 체계에서 결정될 가능성이 큽니다. 아무리 뛰어난 추론 모델이라도 회사의 업무 시스템과 연결되지 못하고, 권한 관리가 불안하며, 작업 상태를 잃어버린다면 현장에서는 제한적으로만 활용될 수 있습니다.
이 관점에서 Google의 대형 모델 전략, OpenAI의 에이전트 제품화, Nvidia의 에이전트 안전 플랫폼은 서로 다른 경쟁 축을 보여줍니다. 어떤 기업은 더 강력한 모델을 만들고, 어떤 기업은 사용자가 즉시 체감할 수 있는 업무 자동화를 설계하며, 또 다른 기업은 에이전트가 허용 범위를 벗어나지 않도록 통제하는 기반을 제공합니다.
앞으로 테크 시장에서 중요한 질문은 “어느 모델이 벤치마크에서 더 높은 점수를 받았는가”가 아닐 수 있습니다. 대신 “어느 AI가 우리 조직의 업무를 더 안전하게, 더 적은 감독으로, 끝까지 완료하는가”가 핵심 기준이 될 것입니다.
dots의 등장은 바로 그 경쟁의 무게중심이 모델 성능에서 업무 완결성, 그리고 에이전트 생태계로 이동하고 있음을 보여줍니다.
테크: 리서치부터 DevOps까지, 디지털 동료에게 맡길 수 있는 일
에이전트에게 “보고서를 써줘”라고 요청하는 것과, 필요한 자료를 계속 모으고 변화가 생길 때마다 초안을 갱신하도록 맡기는 일은 전혀 다릅니다. 전자는 한 번의 결과물을 받는 대화형 요청입니다. 후자는 목표, 일정, 자료원, 검토 기준을 기억하며 움직이는 장기 미션입니다.
dots와 같은 항상-on 에이전트 시스템이 주목받는 이유도 여기에 있습니다. 사용자가 매번 프롬프트를 입력하지 않아도, 에이전트가 정해진 범위 안에서 정보를 관찰하고 작업을 이어 가는 ‘디지털 동료’ 역할을 할 가능성을 보여주기 때문입니다.
리서치: 자료 수집이 아니라 맥락의 축적
가장 먼저 변화가 예상되는 영역은 리서치입니다. 기존 생성형 AI는 사용자가 질문한 시점의 답변을 만드는 데 강했습니다. 반면 장기 에이전트는 특정 주제를 지속적으로 추적하는 방식으로 작동할 수 있습니다.
예를 들어 기업이 “경쟁사의 AI 제품 출시와 가격 정책 변화를 매주 정리해 달라”는 목표를 설정했다고 가정해 보겠습니다. 에이전트는 다음과 같은 흐름으로 업무를 수행할 수 있습니다.
- 신뢰 가능한 뉴스, 공시, 기술 블로그, 제품 업데이트 페이지를 지속적으로 모니터링합니다.
- 새로 확인된 정보를 기존 리서치 노트와 비교합니다.
- 단순 반복 기사나 신뢰도가 낮은 출처는 분리합니다.
- 가격 인상, 신규 기능, 파트너십처럼 중요한 변화만 우선순위로 분류합니다.
- 정해진 시점에 요약 보고서와 함께 “지난주 대비 달라진 점”을 제시합니다.
핵심은 요약 자체가 아닙니다. 시간에 따라 쌓이는 맥락을 유지한다는 점입니다. 사람이 매번 자료를 다시 찾고 비교하는 대신, 에이전트가 변화의 이력을 관리하는 구조에 가깝습니다.
다만 외부 정보는 오류나 편향을 포함할 수 있습니다. 따라서 중요한 의사결정에 쓰일 리서치라면 출처 링크, 수집 시점, 신뢰도 기준, 사람의 최종 검토 절차를 함께 설계해야 합니다.
보고서와 운영 업무: 초안을 ‘계속 준비하는’ 시스템
보고서 업무에서도 역할이 달라집니다. “이번 주 실적 보고서를 작성해 줘”라는 요청은 단발성 자동화입니다. 그러나 장기 에이전트는 보고서 제출일이 오기 전부터 필요한 데이터를 모으고, 누락을 찾고, 초안을 준비할 수 있습니다.
예를 들어 주간 사업보고서 미션은 다음과 같이 구성할 수 있습니다.
- 매일 CRM, 광고 대시보드, 고객 문의 시스템의 핵심 지표를 수집
- 목표 대비 성과를 계산하고 급격한 변동을 탐지
- 변동 원인을 확인할 수 있는 관련 캠페인, 장애 기록, 고객 피드백을 연결
- 금요일에 임원용 요약본과 실무자용 상세 초안을 각각 생성
- 수치가 기준을 벗어나면 보고서 발행 전 담당자에게 검토 요청
이런 방식은 문서 작성 시간을 줄이는 데 그치지 않습니다. 데이터 수집, 이상 징후 감지, 원인 후보 정리, 보고서 작성이라는 분리된 업무를 하나의 흐름으로 연결합니다. 테크 업계가 에이전트 UX에 주목하는 이유도 바로 이 종단 간 업무 오케스트레이션에 있습니다.
마케팅과 고객 운영: 반복 실행보다 지속적인 관찰
마케팅 운영에서는 에이전트가 ‘캠페인 실행 도구’보다 ‘상시 분석 파트너’에 가까워질 수 있습니다.
가령 신규 고객 전환율을 높이는 것이 목표라면, 에이전트는 채널별 유입과 전환 데이터를 관찰하고 특정 세그먼트의 이탈률이 높아졌을 때 원인을 분석하도록 설계할 수 있습니다. 랜딩 페이지 변경, 광고 예산 조정, 이메일 발송 일정 같은 요인을 함께 비교해 개선안을 제안하는 방식입니다.
다만 고객에게 메시지를 발송하거나 예산을 변경하는 행위는 직접적인 사업 리스크를 만듭니다. 따라서 다음처럼 권한을 나누는 것이 바람직합니다.
- 관찰 권한: 데이터 조회와 이상 징후 탐지
- 제안 권한: 개선안 작성과 실행 우선순위 추천
- 승인 대기 권한: 예산 변경, 메시지 발송, 고객 정보 수정
- 제한된 실행 권한: 사전에 승인한 범위 안의 반복 작업 자동화
에이전트의 자율성은 높을수록 좋은 것이 아닙니다. 업무의 영향도에 따라 자율성과 승인 단계를 다르게 설계해야 합니다.
개발과 DevOps: 코드를 쓰는 도구에서 시스템을 돌보는 동료로
개발 영역은 장기 에이전트의 효용이 특히 큰 분야입니다. 코드 생성은 이미 익숙한 기능이지만, 실제 개발 현장에서는 코드 한 줄을 만드는 일보다 코드베이스와 운영 환경을 지속적으로 관리하는 일이 더 많은 시간을 차지합니다.
에이전트는 다음과 같은 장기 미션을 맡을 수 있습니다.
- 저장소의 변경 사항을 추적하며 테스트 커버리지 하락 구간 탐색
- 의존성 패키지의 보안 취약점 및 업데이트 필요성 점검
- 장애 알림, 애플리케이션 로그, 인프라 지표를 연결해 원인 후보 제시
- 반복적으로 발생하는 배포 실패 패턴 분석
- 기술부채 목록을 정리하고 영향도와 수정 난이도 기준으로 우선순위화
- 문서와 실제 코드의 차이를 찾아 문서 업데이트 초안 생성
DevOps 환경에서는 특히 관찰-판단-실행의 분리가 중요합니다. 에이전트가 로그를 분석해 “데이터베이스 연결 풀이 포화 상태일 가능성이 높다”고 제안하는 것과, 실제 운영 서버를 재시작하거나 설정을 바꾸는 것은 전혀 다른 수준의 행동입니다.
따라서 초기 도입 단계에서는 읽기 전용 접근 권한과 제안 중심 역할로 시작하는 편이 안전합니다. 이후 신뢰도가 검증된 반복 작업에 한해, 롤백 가능성과 감사 로그를 갖춘 자동 실행 권한을 부여해야 합니다.
잘 맡기기 위한 조건: 목표·권한·검토 기준
디지털 동료가 유용해지려면 “알아서 해줘”라는 지시만으로는 부족합니다. 장기 미션에는 적어도 세 가지가 필요합니다.
| 설계 요소 | 확인할 질문 |
|---|---|
| 목표 | 무엇을 개선하거나 완료해야 하는가? |
| 범위 | 어떤 데이터, 앱, 팀 도구에 접근할 수 있는가? |
| 성공 기준 | 언제, 어떤 결과가 나오면 잘 수행한 것인가? |
| 권한 | 제안만 할 수 있는가, 실행도 가능한가? |
| 승인 절차 | 사람의 확인이 반드시 필요한 행동은 무엇인가? |
| 기록 | 어떤 판단과 실행을 로그로 남길 것인가? |
결국 에이전트 도입의 핵심은 사람을 완전히 배제하는 데 있지 않습니다. 사람이 목표와 경계를 설정하고, 에이전트가 지속적인 관찰과 준비를 맡으며, 중요한 실행은 적절한 승인 절차를 거치는 구조를 만드는 데 있습니다.
리서치부터 보고서, 고객 운영, DevOps까지. 앞으로의 테크 경쟁은 AI가 한 번에 얼마나 그럴듯한 답변을 만드는가보다, 얼마나 안전하고 꾸준하게 실제 업무를 이어 갈 수 있는가에서 갈릴 가능성이 큽니다.
테크 자율성의 마지막 문턱: 어디까지 맡기고, 어디서 멈출 것인가
AI가 목표를 잊지 않는 능력은 강력합니다. 그러나 이는 곧 잘못 설정된 목표도 오랫동안 추적할 수 있다는 뜻이기도 합니다. 항상 켜져 있는 에이전트의 시대에 진짜 질문은 더 이상 “무엇을 할 수 있는가”가 아닙니다. 이제는 “무엇을 해도 되는가, 그리고 언제 반드시 멈춰야 하는가”가 핵심입니다.
dots처럼 여러 앱을 넘나들며 장기 목표를 수행하는 에이전트는 단순한 챗봇과 다릅니다. 일정 정리나 문서 요약을 넘어, 이메일 발송·CRM 업데이트·재고 조정·배포 실행처럼 실제 업무 흐름에 영향을 줄 수 있습니다. 이때 작은 판단 오류도 반복 실행과 결합하면 큰 피해로 확대될 수 있습니다.
목표가 지속될수록 커지는 위험
상시 동작형 에이전트의 위험은 단발성 실수보다 지속성에서 나옵니다. 예를 들어 “비용을 줄여라”라는 목표만 부여된 에이전트는 단기 지표를 개선하기 위해 고객 지원 인력, 보안 검토, 품질 관리 같은 중요한 절차를 과도하게 축소할 수 있습니다.
문제는 AI가 악의를 가졌기 때문이 아닙니다. 목표가 불완전하거나, 성공 기준이 지나치게 단순하거나, 권한 범위가 넓을 때 발생합니다. 에이전트는 주어진 목표를 충실히 최적화할 뿐이며, 조직의 암묵적 맥락과 윤리적 판단까지 자동으로 이해한다고 기대해서는 안 됩니다.
특히 다음 상황은 주의가 필요합니다.
- 목표의 모호성: “성과를 높여라”, “문의 수를 줄여라”처럼 해석 여지가 큰 지시
- 과도한 권한: 결제, 계약, 고객 데이터 삭제, 시스템 배포 권한을 한 번에 부여하는 경우
- 외부 입력 오염: 이메일·웹페이지·문서에 숨겨진 프롬프트 인젝션이 에이전트의 행동을 바꾸는 경우
- 피드백 지연: 잘못된 판단이 며칠 또는 몇 주 동안 누적된 뒤에야 발견되는 경우
맡길 일과 승인받을 일을 분리해야 한다
현실적인 해법은 “AI에게 아무것도 맡기지 않는 것”이 아닙니다. 핵심은 업무를 위험도에 따라 분리하고, 자율성의 경계를 명확히 설정하는 것입니다.
| 업무 유형 | 에이전트 자율 실행 | 사람의 승인 필요 |
|---|---|---|
| 정보 수집·요약 | 가능 | 예외 상황만 검토 |
| 보고서 초안·회의록 작성 | 가능 | 외부 공유 전 검토 |
| 일정 제안·알림 | 가능 | 중요 일정 변경 시 승인 |
| 고객 이메일 초안 | 가능 | 발송 전 승인 또는 정책 검증 |
| 결제·계약·환불 | 제한적 | 원칙적으로 필수 승인 |
| 인사 평가·채용 탈락 | 불가 또는 강한 제한 | 인간의 최종 판단 |
| 운영 시스템 배포·데이터 삭제 | 제한적 | 다단계 승인 및 롤백 체계 |
이 원칙은 단순합니다. 되돌리기 쉬운 일은 자동화하고, 되돌리기 어려운 일은 멈추게 하라는 것입니다. 초안 작성, 모니터링, 이상 탐지, 선택지 제안은 에이전트의 강점입니다. 반면 법적 책임, 금전 손실, 개인정보, 평판 피해가 걸린 결정은 인간이 최종 통제권을 가져야 합니다.
안전한 에이전트 운영을 위한 기술적 장치
테크 업계가 주목하는 것은 모델 자체의 안전성만이 아닙니다. 에이전트가 실제 도구와 데이터에 연결될수록, 모델 바깥의 통제 계층이 중요해집니다.
가장 기본적인 장치는 다음 네 가지입니다.
최소 권한 원칙
에이전트에는 필요한 만큼의 권한만 부여해야 합니다. 예를 들어 고객 데이터를 조회할 수 있는 에이전트가 곧바로 삭제·내보내기까지 할 수 있어서는 안 됩니다. 읽기, 작성, 승인, 실행 권한을 분리하는 것이 핵심입니다.정책 기반 실행 게이트
특정 행동은 AI의 판단만으로 실행되지 않도록 해야 합니다. 송금, 외부 이메일 발송, 배포, 데이터 삭제와 같은 작업에는 정책 엔진이 개입해 금액·대상·시간·조건을 검증해야 합니다.감사 로그와 추적 가능성
에이전트가 어떤 정보에 접근했고, 어떤 이유로 도구를 호출했으며, 어떤 결과를 만들었는지 기록해야 합니다. 문제가 발생했을 때 “AI가 그렇게 했다”는 말로 끝나서는 안 됩니다. 재현 가능한 로그가 있어야 원인을 분석하고 권한을 조정할 수 있습니다.중단 장치와 롤백 설계
에이전트에는 즉시 작업을 멈추는 킬 스위치가 필요합니다. 또한 이미 실행된 작업을 되돌릴 수 있도록 버전 관리, 승인 대기열, 배포 롤백, 변경 이력 보존 체계를 함께 갖춰야 합니다.
Nvidia의 에이전트 안전 플랫폼처럼, 에이전트와 분리된 외부 보안 계층을 두려는 움직임은 이런 이유에서 중요합니다. AI가 스스로 안전하다고 판단하는 것만으로는 부족합니다. AI의 행동을 감시하고 제한할 독립적인 시스템이 필요합니다.
좋은 목표는 지시문이 아니라 운영 계약이다
에이전트에게 목표를 맡길 때는 “무엇을 달성할지”만 말해서는 부족합니다. 목표와 함께 다음을 정의해야 합니다.
- 성공으로 간주할 기준은 무엇인가
- 절대 해서는 안 되는 행동은 무엇인가
- 비용·시간·권한의 한도는 어디까지인가
- 어떤 상황에서 사람에게 보고해야 하는가
- 충돌하는 목표가 생기면 무엇을 우선해야 하는가
가령 “매출을 높여라”보다 좋은 지시는 다음과 같습니다.
기존 고객의 이탈률을 낮추기 위한 개선안을 매주 제안하되, 고객 데이터는 승인된 CRM 범위에서만 조회한다. 할인 쿠폰 발행, 외부 메시지 발송, 가격 변경은 담당자의 승인을 받은 뒤 실행한다. 개인정보 또는 법적 이슈가 감지되면 즉시 작업을 중단하고 보고한다.
이처럼 잘 설계된 목표는 에이전트의 능력을 제한하는 장치가 아니라, 오히려 더 안정적으로 성과를 내게 하는 운영 프레임입니다.
자율성은 기능이 아니라 책임의 문제다
앞으로의 테크 경쟁은 누가 더 긴 작업을 자동화하느냐에만 달려 있지 않을 것입니다. 더 중요한 경쟁력은 얼마나 안전하게 권한을 위임하고, 얼마나 명확하게 책임을 추적하며, 얼마나 빠르게 멈출 수 있는가에 있습니다.
AI 에이전트는 훌륭한 디지털 동료가 될 수 있습니다. 하지만 동료에게도 역할, 권한, 보고 체계, 금지선을 정하듯 에이전트에도 같은 원칙이 필요합니다. 자율성을 넓히는 일과 통제력을 잃는 일은 다릅니다. 에이전트 시대의 승자는 AI에게 가장 많은 일을 맡기는 조직이 아니라, 가장 현명하게 맡기고 가장 확실하게 멈출 수 있는 조직이 될 것입니다.
