대답하는 AI에서,함께 일하는 AI로

AI는 문맥을 읽고 자료를 찾는 단계를 거쳐, 결과를 바탕으로 다음 행동을 고르는 업무 시스템으로 발전했습니다.

설명용 가상 업무 예시입출금 지연 문의의 답변 초안을 만들어줘

공개 자료로 안내문을 만드는 것과 고객에게 실제로 발송하는 일은 다릅니다.

  1. 요청
    문의 대상과 상황을 확인한다

    가상자산, 네트워크, 문의 시점을 읽는다

  2. 자료
    최신 공지와 이용 안내를 찾는다

    확인한 시점과 출처를 함께 남긴다

  3. 초안
    확인된 사실만으로 안내문을 만든다

    추정 원인이나 매매 판단은 넣지 않는다

  4. 발송
    담당자가 승인한 답변만 보낸다

    개별 계정 확인이 필요하면 자동 발송을 멈춘다

이 페이지의 빗썸 업무 사례는 공개된 서비스 영역을 바탕으로 만든 설명용 가상 예시입니다. 실제 내부 절차나 자동화 계획을 뜻하지 않습니다.

답변에서 실행으로 넘어갈 때, 확인할 것도 늘어난다

문맥 읽기단어 사이의 관계를 파악한다
여러 언어 작업요약과 번역, 초안을 한 모델이 맡는다
자료 찾기최신 문서와 사내 자료를 검색한다
행동 선택결과를 보고 다음 계획을 고른다
도구 실행파일과 업무 시스템을 다룬다
운영 통제권한과 검사, 기록, 승인을 붙인다

단어 사이의 관계를 함께 살피기 시작했다

가상자산 출금 문의를 이해하는 상황출금이 늦어서 거래를 못 했어요

'출금'과 '거래'를 따로 읽지 않고 주변 단어의 관계를 봐야 고객이 겪은 상황을 파악할 수 있습니다.

  1. 1
    문의에 나온 표현을 본다

    출금 / 늦다 / 거래 / 못 했다

  2. 2
    표현 사이의 관계를 찾는다

    출금 지연이 다음 거래를 막았다는 흐름을 읽는다

  3. 3
    문의의 뜻을 정리한다

    출금 지연으로 거래에 불편을 겪었다는 요청이다

핵심문맥 창 안에서 앞뒤 단어가 서로 어떤 뜻을 더하는지 으로 계산한다.

는 문맥 창 안에서 서로 관련이 깊은 단어를 으로 찾는다. 단어를 하나씩 순서대로 처리하던 이전 구조보다 병렬 학습에 유리했고, 멀리 떨어진 단어의 관계도 더 효과적으로 다뤘다. 지금 쓰이는 대형 언어 모델 대부분이 이 구조에서 출발했다.

업무 예시고객이 '출금이 늦어서 다음 거래를 못 하고 있어요'라고 쓰면 '출금', '늦다', '거래', '못 하다'를 연결해 출금 지연으로 불편을 겪는 문의라고 읽는다.

실무에서 달라진 점
요약, 번역, 질문 답변처럼 서로 다른 언어 작업을 같은 계열의 모델로 처리할 기반이 생겼다.
확인할 점
문맥을 잘 읽는 능력과 사실을 정확히 아는 능력은 다르다. 은 사실을 보관하는 데이터베이스가 아니므로 중요한 정보는 원문이나 업무 시스템에서 다시 확인해야 한다.

한 모델로 여러 언어 작업을 처리하게 됐다

고객지원 운영 회의를 요약하는 상황결정 사항과 담당자만 정리해줘

한 모델이 배운 문장 패턴을 요약이나 번역, 초안 작성에 두루 씁니다.

  1. 1
    사람이 요청한다

    입출금 문의 대응 회의에서 결정과 담당자를 추린다

  2. 2
    LLM이 먼저 정리한다

    중요해 보이는 내용을 묶어 초안을 쓴다

  3. 3
    사람이 빠진 내용을 확인한다

    누락된 결정이나 틀린 사실을 고친다

핵심많은 글을 미리 읽은 모델 하나가 요약도 하고, 번역도 하고, 질문에도 답한다.

대량의 글로 미리 학습한 은 요약, 번역, 질문 답변, 초안 작성을 한 모델에서 처리했다. 가 더해지면서 사용자의 지시를 따르는 능력도 나아졌다. prompting은 중간 계산을 유도했고, 이후 은 답을 만들기 전에 더 많은 연산을 쓰는 방향으로 발전했다.

업무 예시입출금 문의 대응 회의 메모와 함께 '결정 사항, 담당자, 기한만 정리해줘'라고 요청하면 곧바로 요약 초안을 받을 수 있다.

실무에서 달라진 점
업무마다 별도의 AI를 만들 필요가 줄었다. 평소 쓰는 말로 요청하면 같은 모델이 초안 작성과 간단한 분석을 맡는다.
확인할 점
여러 단계로 한 답도 틀릴 수 있다. 문장이 자연스럽다고 내용까지 맞는 것은 아니다. 결과에 책임이 따르는 일은 사람이 원문과 수치를 확인해야 한다.

대답하기 전에 필요한 문서부터 찾았다

최신 입출금 안내를 찾는 상황이 가상자산은 지금 입출금할 수 있나요?

RAG는 모델의 기억 대신 현재 공지와 이용 안내를 검색해 답의 근거를 찾습니다.

  1. 1
    확인할 대상을 특정한다

    가상자산 이름과 네트워크를 확인한다

  2. 2
    현재 자료를 찾아본다

    최신 입출금 공지와 이용 안내를 검색한다

  3. 3
    확인 시점과 출처를 붙여 답한다

    현재 상태와 관련 공지 링크를 함께 보여준다

핵심모델의 기억만 믿지 않고, 질문과 관련된 자료를 찾아 읽힌 뒤 답하게 한다.

는 질문과 관련된 문서를 검색해 에 함께 건넨다. 이 방식을 쓰면 모델을 다시 학습하지 않아도 공지, 이용 안내, 운영 매뉴얼처럼 자주 바뀌는 자료를 답변에 반영할 수 있다.

업무 예시'이 가상자산은 지금 입출금할 수 있나요?'라는 질문을 받으면 최신 입출금 공지와 이용 안내를 찾고, 확인 시점과 링크를 붙여 답한다.

실무에서 달라진 점
의 쓰임이 입출금 상태 안내와 고객지원처럼 최신 출처가 필요한 업무로 넓어졌다.
확인할 점
검색한 문서가 엉뚱하거나 오래됐다면 답도 틀어진다. 출처를 붙였다는 사실만으로 그 출처가 정확하거나 최신이라고 볼 수는 없다.

해본 결과를 보고 다음 행동을 골랐다

고객 문의가 늘어난 원인을 살피는 상황지난 24시간 문의 급증 원인을 정리해줘

문의 분류만 보고 끝내지 않습니다. 관련 공지와 서비스 상태가 빠졌다면 다시 확인합니다.

  1. 1
    문의 변화를 확인한다

    시간대와 문의 유형별 증가 폭을 살핀다

  2. 2
    공개 운영 정보를 대조한다

    관련 공지와 입출금 상태를 함께 본다

  3. 3
    빠진 근거를 다시 찾는다

    원인을 단정하기 전에 확인되지 않은 항목을 표시한다

  4. 4
    근거와 미확인점을 나눠 보고한다

    확인된 사실과 추가 조사할 항목을 담당자에게 보여준다

핵심처음부터 모든 순서를 정하지 않는다. 한 단계씩 해보고, 나온 결과에 맞춰 다음 일을 고른다.

는 판단하고 도구를 쓴 뒤, 그 결과를 보고 다음 행동을 고르는 과정을 반복한다. 는 목표와 현재 상황에 맞춰 검색하고 비교하고 문서를 만든다. 새 정보가 나오거나 오류가 생기면 계획도 바꾼다.

업무 예시'지난 24시간 고객 문의가 왜 늘었는지 정리해줘'라는 요청을 받으면 문의 유형과 시간대를 확인한다. 관련 공지나 입출금 상태가 빠져 있으면 다시 찾아보고, 확인된 사실과 미확인점을 나눠 보고한다.

실무에서 달라진 점
이제 AI가 검색 한 번으로 끝나지 않는 조사와 파일 작성, 시스템 입력을 이어서 처리한다.
확인할 점
단계가 길어지면 앞서 본 내용을 잊거나 같은 실수를 반복하기 쉽다. 실행 시간과 비용도 늘어난다. 순서가 늘 같은 일이라면 보다 가 단순하고 안전하다.

방법을 설명하던 AI가 도구를 직접 쓰기 시작했다

고객 안내를 게시하는 상황입출금 안내 초안을 고객센터에 올려줘

초안 작성과 게시 준비는 AI가 맡아도, 고객에게 공개하기 전에는 담당자가 내용과 대상을 확인합니다.

  1. 1
    근거 자료를 불러온다

    확정된 운영 정보와 기존 안내 양식을 확인한다

  2. 2
    안내 초안을 만든다

    대상 자산, 적용 시점, 고객이 확인할 경로를 채운다

  3. 3
    담당자가 내용을 확인한다

    사실, 시점, 표현, 공개 범위가 맞는지 검토한다

  4. 4
    승인된 문안만 게시한다

    승인 전에는 고객센터 내용을 바꾸지 않는다

핵심AI에 검색기, 데이터베이스, 고객지원 도구를 연결해 말뿐 아니라 실제 작업도 맡긴다.

를 이용하면 AI가 검색기, 계산기, 데이터베이스, 고객지원 도구를 정해진 형식으로 호출할 수 있다. 가 없는 프로그램은 로 화면을 조작한다. 는 도구와 마다 달랐던 연결 방식을 맞추려는 규격이다.

업무 예시'입출금 안내 초안을 고객센터에 올려줘'라고 하면 확정된 운영 정보와 기존 양식으로 문안을 만든다. 고객에게 공개하는 작업은 담당자가 사실과 시점을 확인하고 승인한 뒤에만 실행한다.

실무에서 달라진 점
AI가 설명과 초안을 넘어 조회, 분류, 등록, 테스트 같은 실무의 일부를 직접 처리하게 됐다.
확인할 점
도구를 연결했다고 안전이 따라오는 것은 아니다. 쓰기, 삭제, 구매, 외부 공개 권한은 좁게 주고, 되돌리기 어려운 행동은 사람이 승인해야 한다.

모델 밖의 작업 환경이 성패를 가르기 시작했다

입출금 지연 문의를 처리하는 상황고객 안내가 발송되기까지

AI가 일을 끝내기까지 어떤 자료를 읽고, 어디서 멈추고, 무엇을 기록하는지 보여줍니다.

  1. 자료 찾기
    관련 공지와 이용 안내를 불러온다

    대상 자산과 네트워크, 공지 시점을 확인한다

  2. 문의 분류
    공개 정보로 답할 수 있는지 가른다

    개별 계정 조회가 필요한 문의는 따로 표시한다

  3. 초안 작성
    확인한 사실만으로 안내문을 만든다

    추정 원인이나 매매 판단은 넣지 않는다

  4. 사람에게 넘기기
    계정 정보나 금전 영향이 있으면 멈춘다

    권한 있는 담당자가 추가 확인한다

  5. 기록 남기기
    출처와 중단 이유를 저장한다

    사용한 공지와 검토 상태를 로그에 남긴다

핵심AI 모델에 필요한 자료와 도구를 연결하고, 권한과 검사 기준, 기록 방식까지 한 작업 환경으로 묶는다.

는 목표와 지시, 참고 자료, 검색과 , 도구, 실행 순서, 권한, , , , 승인 화면을 함께 설계하는 작업 환경이다. 같은 모델을 써도 무엇을 읽고 어디까지 실행할 수 있는지, 결과를 어떻게 검사하는지에 따라 성능과 위험이 달라진다.

업무 예시입출금 지연 문의를 처리한다면 관련 공지와 이용 안내를 먼저 찾는다. 개별 계정 조회나 금전 영향 판단이 필요하면 자동 답변을 멈추고 권한 있는 담당자에게 넘긴다. 어떤 자료를 확인했고 왜 멈췄는지도 기록한다.

실무에서 달라진 점
모델을 고르는 일만으로는 부족하다. 업무 자료, 완료 기준, 실패했을 때의 처리 방식, 과 감사 기록까지 함께 설계해야 한다.
확인할 점
는 하나의 공식 표준이나 특정 제품 이름이 아니다. 어떤 구성은 특정 실험에서 잘 작동했을 뿐, 모든 회사와 업무에서 같은 결과를 낸다고 볼 수 없다.
도입 현황

AI는 널리 쓰지만, 에이전트 운영은 아직 드물다

회사 도입 수준을 비교하는 상황AI를 쓰는 것과 에이전트를 운영하는 것은 다르다

같은 보고서에 소개됐지만 서로 다른 범주를 재는 수치입니다. 한 단계씩 이어지는 비율처럼 비교할 수는 없습니다.

  1. 88%
    AI를 쓴 조직

    조사에 참여한 조직 중 AI를 사용한 비율

  2. 70%
    생성형 AI를 쓴 조직

    적어도 한 가지 업무에서 사용한 비율

  3. 한 자릿수
    에이전트를 배치한 업무

    대부분의 업무에서는 아직 드물다

핵심AI 채팅을 써본 회사는 많지만, 여러 단계의 업무를 에 맡겨 운영하는 회사는 아직 많지 않다.

2026 AI Index에서 2025년 조사 대상 조직의 88%는 AI를 사용했다고 답했다. 70%는 적어도 한 가지 업무에서 를 썼다. 반면 업무별 AI 배치 비율은 대부분 한 자릿수였다.

업무 예시직원에게 AI 계정을 나눠 주는 일은 어렵지 않다. 고객 문의 답변 발송이나 운영 공지 게시를 맡기려면 최신 자료를 연결하고, 공개 권한과 오류 처리 범위, 사람이 개입할 시점을 정해야 한다.

실무에서 달라진 점
성과는 직무, 사용자의 숙련도, 연결한 도구, 검토 시간에 따라 달랐다. 계정을 배포하는 데서 끝내지 말고 기존 업무 절차도 함께 바꿔야 한다.
확인할 점
88%, 70%, 한 자릿수라는 수치는 서로 다른 범주와 문항을 측정한다. 한 단계씩 이어지는 비율처럼 비교하거나 우리 회사의 예상 성과로 가져다 써서는 안 된다.

자율성은 높을수록 좋은 점수가 아니다

AI가 혼자 몇 단계나 처리하는지보다, 어떤 일을 맡기고 어디서 사람이 확인할지가 더 중요합니다. 아래 구분은 운영 방식을 비교하기 위한 설명이며 공인된 성숙도 단계가 아닙니다.

코파일럿

사람이 매번 방향을 잡고 AI는 초안을 냅니다.

워크플로

순서가 정해진 반복 업무를 그대로 처리합니다.

에이전트

목표와 상황을 보고 다음 행동을 고릅니다.

조직 운영

회사가 권한과 검사 기준, 중단 시점, 책임자를 정합니다.

순서가 늘 같은 일에는 워크플로를 씁니다. 에이전트는 예외가 많아 다음 행동을 미리 정하기 어려울 때만 필요합니다.

첫 자동화는 작고 되돌릴 수 있어야 한다

공개 공지 검색이나 고객 문의 분류처럼 결과를 바로 확인할 수 있는 반복 업무 하나를 고릅니다. 처음부터 고객 답변 발송이나 계정 조회 권한을 줄 필요는 없습니다.

현재 걸리는 시간과 오류를 잰다

입출금 안내 문의처럼 범위가 분명한 업무를 고릅니다. 한 달 처리량, 한 건에 걸리는 시간, 잘못된 출처를 붙인 횟수를 기록합니다.

읽고 정리하는 기능만 연다

공개 공지 검색, 문의 분류, 답변 초안부터 시험합니다. 개인정보를 제거한 사례 30~100개로 정확도, 출처 누락, 담당자의 수정 시간을 함께 잽니다.

내부 검토함까지만 연결한다

승인 전 초안을 내부 검토함에 넣는 것처럼 되돌릴 수 있는 쓰기만 허용합니다. 고객 발송, 계정 정보 조회, 공지 게시, 자산에 영향을 주는 판단은 담당자가 승인합니다.

AI는 자료를 찾고 초안을 만들 수 있습니다. 고객과 자산에 영향을 주는 판단과 실행은 권한 있는 사람이 확인합니다.
회사 기밀과 개인정보는 회사가 승인한 AI 도구에만 입력합니다.

본문 해설과 출처 24건

대답하는 AI에서, 함께 일하는 AI로

오늘의 AI는 질문에 답하는 데서 멈추지 않는다. 필요한 자료를 찾고, 도구를 쓰고, 결과에 따라 다음 행동을 고른다. 이런 변화가 한꺼번에 일어난 것은 아니다. AI에 어떤 능력이 차례로 더해졌는지 살펴보면, 맡겨도 되는 일과 사람이 확인해야 할 지점도 자연스럽게 보인다.
기준일: 2026-08-09 · 공개 논문, 공식 기술 문서, 기관·기업 보고서 기반

사례 범위: 이 글의 빗썸 업무 사례는 공개된 가상자산 거래소 서비스 영역을 바탕으로 만든 설명용 가상 예시다. 실제 빗썸의 내부 절차나 도입 계획을 설명하지 않으며, 가격 예측·매매 추천·자동 거래·거래지원 여부 판단은 사례에서 제외했다.

모델 이름만으로는 실제 업무 성능을 알 수 없다

2017년 가 등장한 뒤 언어 모델은 빠르게 커졌다. 사람의 지시를 따르는 법을 배웠고 검색기, 계산기, 브라우저, 사내 시스템도 직접 쓰기 시작했다. 한 번 답하고 끝나던 AI가 여러 작업을 이어서 처리하게 된 것이다.

모델만 놓아둔다고 일이 돌아가지는 않는다. 읽어야 할 자료와 사용할 도구를 연결하고, 실행 내역을 남기고, 돈이나 개인정보가 걸린 행동 앞에는 사람의 승인을 두어야 한다. 이처럼 모델 주변에 붙는 작업 환경을 ()라고 부른다. 자동차로 치면 모델은 엔진이고, 하네스는 브레이크와 계기판, 운전 규칙까지 포함한 나머지 장치다.

실무 결과는 모델의 성능표만으로 정해지지 않는다. 어떤 자료와 도구를 연결했는지, 어디까지 권한을 줬는지, 어떤 조건에서 시험했는지가 함께 작용한다. 모델 이름이나 벤치마크 점수만 비교해서는 이 차이를 볼 수 없다.


1. AI에는 어떤 능력이 차례로 더해졌나

아래 연도는 대표 논문이나 공개 발표가 나온 시점이다. 여러 연구가 겹쳐 발전한 분야이므로 특정 회사나 논문 한 편을 최초의 시작점으로 단정하지 않았다.

2017: 가 문맥 안의 단어 관계를 읽다

Transformer는 문맥 창 안에서 어떤 단어끼리 관련이 깊은지 으로 계산한다. 단어를 하나씩 순서대로 처리하던 이전 순환신경망보다 병렬 학습에 유리했고, 멀리 떨어진 단어의 관계도 더 효과적으로 다뤘다. 오늘날 대규모 언어 모델() 대부분이 이 구조에서 출발한다.

2018~2020: 한 모델로 여러 언어 작업을 처리하다

()은 많은 글을 읽고 다음에 올 단어를 맞히면서 언어의 패턴을 익히는 과정이다. 이렇게 만든 LLM 하나가 요약, 번역, 질문 답변, 초안 작성을 두루 처리했다. 업무가 바뀔 때마다 모델을 처음부터 다시 만들 필요도 줄었다.

다만 LLM은 사실을 차곡차곡 보관한 데이터베이스가 아니다. 문맥에 어울릴 법한 표현을 만들어내기 때문에 틀린 내용을 자신 있게 말할 수도 있다.

2020: 가 답하기 전에 문서를 찾다

검색 증강 생성(RAG)은 질문과 관련된 문서를 찾아 모델에 함께 건넨다. 모델을 다시 훈련하지 않아도 최신 공지, 이용 안내, 운영 매뉴얼처럼 자주 바뀌는 자료를 답변에 반영할 수 있다.

검색 결과가 엉뚱하거나 오래됐다면 답변도 틀어진다. RAG는 답의 출처를 보여줄 수 있지만, 그 출처가 정확한지까지 보장하지는 않는다. 환각도 완전히 사라지지 않는다.

2021: 하나의 기반 모델을 여러 제품에 쓰다

은 폭넓은 데이터로 먼저 학습한 뒤 여러 작업과 제품에 맞게 조정해 쓰는 기반 모델이다. 하나의 모델을 여러 서비스가 나눠 쓰면서 장점과 위험도 함께 퍼졌다. 기업은 모델을 직접 만들지 않고도 나 공개 모델에 자사 데이터와 업무 절차를 연결할 수 있었다.

2022: 사람의 지시를 더 잘 따르도록 다듬다

사전학습 모델은 문장을 이어 쓰는 데는 능했지만 사용자의 의도를 꾸준히 따르지 못했다. 은 질문과 좋은 답변 예시를 보여주며 모델을 추가로 학습한다. 는 사람들이 어떤 답을 더 낫다고 골랐는지를 이용해 답변 습관을 조정한다. 이 두 방법이 자리 잡으면서 대화형 생성 AI는 일반 사용자에게도 훨씬 다루기 쉬운 도구가 됐다.

2022: 복잡한 문제를 나눠 풀다

계산이나 계획처럼 여러 단계를 거치는 문제는 곧바로 답하게 하면 자주 틀린다. 는 문제를 중간 단계로 나눠 풀도록 유도했다. 최신 은 답을 내기 전에 더 많은 연산을 쓴다. 그래도 오답은 나온다. 문장이 자연스럽다고 내용까지 맞는 것은 아니므로, 책임이 따르는 판단은 사람이 원문과 수치를 확인해야 한다.

2022~2023: 판단한 뒤 도구를 쓰다

는 판단한 뒤 도구를 쓰고, 그 결과를 보고 다음 행동을 고르는 과정을 반복한다. 를 이용하면 검색기, 계산기, 데이터베이스, 고객지원 도구, 코드 실행기를 정해진 형식으로 호출할 수 있다.

언어 모델만으로는 최신 정보를 확인하거나 실제 시스템을 바꿀 수 없다. 도구가 연결되자 AI의 역할은 답변 작성에서 조회, 분류, 등록, 검증으로 넓어졌다.

2023: LLM 가 여러 작업을 이어서 처리하다

소프트웨어 에이전트 연구는 1990년대 이전부터 있었다. 2023년을 전후해 LLM이 계획을 세우고 도구를 쓰며 사람과 자연어로 대화하는 구성이 널리 알려졌다.

챗봇은 보통 질문에 답한다. 에이전트는 목표와 현재 상황을 보고 다음 행동을 고른다. 사람이 순서를 미리 정한 와 달리, 검색 결과가 부족하거나 오류가 생기면 계획을 바꿀 수 있다. 검색, 비교, 파일 작성, 시스템 입력처럼 할 일이 이어지고 예외가 자주 생기는 업무에 알맞다.

2023: 여러 에이전트가 일을 나눠 맡다

여러 에이전트가 조사자, 작성자, 검토자처럼 역할을 나눌 수 있다. 한 에이전트에게 기획과 실행, 검증을 모두 몰아줬을 때 생기는 혼선을 줄이려는 구성이다.

에이전트 수가 많다고 결과가 저절로 좋아지지는 않는다. 메시지를 주고받는 비용이 늘고, 같은 일을 두 번 하거나 한쪽의 오류가 다른 에이전트로 번질 수 있다.

2024: 코딩 에이전트와 가 파일과 화면을 다루다

코드 모델은 코드를 제안하는 데 그쳤다. 코딩 에이전트는 저장소를 읽고 파일을 고친 뒤 테스트까지 실행한다. 테스트가 실패하면 를 읽고 다시 수정한다.

Computer use는 API가 없는 프로그램을 화면의 버튼과 입력창으로 조작한다. 오래된 사내 도구에도 연결할 수 있지만 클릭이나 입력이 제대로 됐는지 확인하기는 더 어렵다. 파일 수정, 구매, 삭제처럼 결과가 남는 행동에는 와 승인 절차가 필요하다.

2024~2025: 가 연결 규격을 맞추다

MCP(Model Context Protocol)는 AI 애플리케이션이 데이터와 도구에 연결되는 방법을 정한 공개 규격이다. A2A(Agent2Agent Protocol)는 서로 다른 공급자나 프레임워크의 에이전트가 각자 할 수 있는 일을 알리고 작업을 주고받게 한다.

공통 규격을 쓰면 도구마다 연결 코드를 새로 만드는 수고는 줄어든다. 연결 규격이 같다고 상대를 믿어도 된다는 뜻은 아니다. 인증과 권한, 데이터가 머무는 위치, 감사 기록은 따로 관리해야 한다.

2025~2026: 가 모델 밖의 차이를 드러내다

는 지시와 , 검색, , 도구, 실행 순서, 권한, 샌드박스, , 로그, 승인 화면을 묶어 부르는 실무 용어다. 같은 모델을 써도 읽는 자료와 사용하는 도구가 다르면 결과도 크게 달라진다. 작업이 길어지면 앞서 본 내용을 잊거나 같은 오류를 반복하고, 권한과 비용이 필요 이상으로 커지기도 한다.

이 용어는 Transformer처럼 논문 한 편에서 공식 정의한 개념이 아니다. 2025~2026년 에이전트와 코딩 에이전트 실무에서 여러 운영 장치를 함께 가리키는 표현으로 쓰이기 시작했다.


2. 어떤 일까지 AI에게 맡길 것인가

Agentic AI와 는 같은 말이 아니다. 여기서 agentic AI는 주어진 목표와 도구, 권한 안에서 다음 행동을 고르는 시스템을 뜻한다. 자율성은 켜고 끄는 단일 기능이 아니다. 사람이 작업 순서를 어디까지 정하고, 어느 지점부터 AI가 고르게 할지에 따라 정도가 달라진다. 아래 네 구분은 운영 방식을 비교하기 위한 설명이며 공인된 성숙도 모형이 아니다.

: 사람이 매번 방향을 잡는다

사람이 요청하면 AI가 초안을 내고, 사람이 확인한 뒤 다음 지시를 준다. 고객 문의 답변 초안이나 입출금 문의 대응 회의 요약처럼 매번 방향을 잡아야 하는 일에 잘 맞는다. 통제하기는 쉽지만 사람이 계속 조작해야 한다.

: 정해진 순서대로 처리한다

'문의 수신 → 유형 분류 → 관련 공개 문서 연결 → 담당자에게 전달'처럼 처리 순서가 미리 정해져 있다. 규칙이 분명한 업무에서는 결과를 예상하기 쉽고, 어느 단계에서 문제가 났는지 기록하기도 편하다.

: 상황에 따라 다음 행동을 고른다

'지난 24시간 고객 문의가 늘어난 이유를 정리하라'는 목표를 받으면 문의 유형과 시간대를 살핀다. 관련 공지나 서비스 상태가 빠졌다면 더 찾아보고, 확인된 사실과 미확인점을 나눠 보고한다. 예외가 많은 지식 업무에 쓸 수 있지만, 할 일이 늘어난 만큼 비용과 실패 지점도 많아진다.

조직 운영: 권한과 책임을 함께 설계한다

사람은 목표와 우선순위를 정하고 애매한 예외를 판단한다. 에이전트는 반복 실행과 정보 처리를 맡는다. 좋은 도구를 사오는 것만으로는 부족하다. 누가 어떤 권한을 갖는지, 결과를 어떻게 할지, 문제가 생기면 누가 멈출지를 조직 차원에서 정해야 한다.

처리 순서가 늘 같은 업무에는 워크플로가 더 싸고 안전하다. 에이전트는 예외가 많아 경로를 미리 정하기 어려운 일에 필요한 만큼만 쓰는 편이 낫다.


3. 하네스는 AI가 일하는 환경을 어떻게 만드는가

목표와 완료 조건

역할, 완료 조건, 금지할 행동, 결과 형식을 정한다. '잘해줘'라고만 쓰지 말고 무엇을 읽어야 하는지, 어디까지 바꿔도 되는지, 어떤 증거가 있어야 끝난 것으로 볼지를 적는다.

작업에 필요한

지금 하는 일에 필요한 자료만 골라 알맞은 순서로 제공한다. 긴 문서를 통째로 넣기보다 관련 공지, 이용 안내, 고객 문의의 범위, 직전 작업, 좋은 예시를 추린다. 이 한 번의 요청 문구를 다듬는 일이라면 은 작업하는 동안 AI가 참고할 정보 전체를 관리하는 일이다.

와 검색

방금 하던 작업의 상태, 사용자 선호, 프로젝트 기록, 지식베이스는 성격이 서로 다르다. 저장할 때도 구분해야 한다. 모든 대화를 무기한 보관하면 개인정보와 잘못된 기억까지 함께 쌓인다. 무엇을 저장하고 언제 지울지, 누가 삭제할 수 있는지를 미리 정해야 한다.

도구와 권한

검색기, 데이터베이스, 고객지원 도구, 파일, 코드 실행기를 연결한다. 공지와 이용 안내를 읽는 권한, 개별 계정 정보를 조회하는 권한, 고객에게 답변을 발송하는 권한은 서로 분리한다. 가능하다면 화면을 클릭하는 방식보다 호출 내용과 결과를 확인하기 쉬운 가 낫다.

은 API와 다르다. API가 프로그램끼리 요청을 주고받는 약속이라면 Skill은 특정 업무의 절차, 전문지식, 스크립트, 템플릿을 묶어 다시 쓰는 단위다.

실행 순서와 중단 조건

는 계획하고 행동한 뒤 결과를 확인하고 필요하면 고친다. 여러 에이전트를 함께 쓴다면 각자의 역할, 결과를 넘길 형식, 반복 횟수, 중단 조건을 정해야 한다. 이 흐름을 실제로 돌리면서 상태 저장, 재시도, 시간 제한, 일시중지와 재개를 처리하는 부분이 이다.

와 승인

에이전트에는 지금 맡은 일에 필요한 권한만 준다. 고객 정보 조회와 외부 전송 범위를 정하고, 답변 발송이나 공지 게시 전에는 사람이 확인한다. 승인 화면에는 무엇을 왜 공개하려는지가 보여야 한다. 내용을 알 수 없는 승인 버튼은 검토 절차가 아니다.

와 안전장치

는 같은 조건에서 결과를 반복 측정하는 시험 세트다. 는 개인정보 노출, 금지 행동, 정책 위반을 감지해 막는다. 정답률만 보지 말고 출처 누락, 사람이 고치는 데 걸린 시간, 실행 비용, 사고 건수도 함께 봐야 한다.

실행 기록과 감사

에이전트가 어떤 지시와 자료를 읽었고 무슨 도구를 호출했는지 기록한다. 최종 결과만 남겨서는 어디서 잘못됐는지 찾기 어렵다. 실행 과정이 있어야 같은 오류를 재현하고 고칠 수 있다.

사람이 개입할 지점

모든 클릭을 사람이 승인한다면 자동화의 이점이 줄어든다. 공개 문서 검색과 문의 분류처럼 되돌릴 수 있는 저위험 작업은 자동화하고, 개별 계정 조회, 고객 답변 발송, 공지 게시, 금전 영향이 있는 판단에는 사람의 확인을 둔다.

연구 범위: SWE-agent 연구에서는 같은 GPT-4 Turbo를 써도 컴퓨터와 연결되는 인터페이스에 따라 문제 해결률이 달랐다. 2026년 Harness-Bench도 모델과 하네스 조합에 따라 점수 차이가 컸다고 보고했다. 두 연구 모두 범위가 제한된 기술 과제를 다뤘으므로, 이 결과를 모든 업무에 그대로 적용할 수는 없다.


4. 첫 자동화 업무를 고르는 기준

첫 실험에는 자주 반복되고 입력과 결과가 파일이나 시스템에 남는 업무가 알맞다. 좋은 결과를 가릴 기준이 있어야 하며, 실수해도 사람이 발견하거나 되돌릴 수 있어야 한다.

고객 자산과 계정에 영향을 주는 처리, 가격 예측과 매매 추천, 거래지원 여부 판단, 이상거래 최종 판정, 개인정보 이용, 외부 공지는 한 번의 오류도 비용이 크다. 이런 업무는 AI에게 자료 정리나 초안까지만 맡기고 최종 판단과 실행은 권한 있는 담당자가 해야 한다.

고객지원과 운영 안내

AI는 문의를 유형별로 묶고 최신 공지와 이용 안내에서 관련 문서를 찾아 답변 초안을 만들 수 있다. 공개 정보만으로 답할 수 없는 문의는 개별 계정 조회가 필요하다고 표시해 담당자에게 넘긴다. 고객에게 보내는 최종 답변과 보상·분쟁 예외 판단은 담당자가 맡는다.

서비스 운영

시간대와 유형별 문의 변화를 요약하고, 공개된 서비스 상태와 관련 공지를 대조해 운영 브리핑 초안을 만들 수 있다. AI는 확인된 사실과 미확인점을 나눠 보여줘야 한다. 장애 원인 단정, 복구 시점 약속, 고객 영향 범위 확정은 담당자가 판단한다.

리스크·준법 보조

공개 규정과 내부 기준에서 관련 조항을 찾아 비교표를 만들고, 검토 문서에서 빠진 근거나 상충하는 표현을 표시하는 데 쓸 수 있다. 다만 이상거래 여부, 신고 의무, 고객 제한 조치처럼 법적·재산적 영향이 있는 판단은 AI가 확정해서는 안 된다.

제품과 콘텐츠

이용 안내와 공지 초안을 채널 형식에 맞게 바꾸고, 화면 문구의 일관성과 누락 링크를 점검할 수 있다. 가상자산 가격 전망이나 매매를 유도하는 표현은 만들지 않도록 막아야 하며, 고객에게 공개되는 문안은 담당자가 사실과 시점을 확인한다.

개발과 IT 운영

코드를 찾고 고치거나 테스트와 문서를 만들고 장애 를 정리하는 데 쓸 수 있다. 아키텍처, 운영 위험, 보안 판단, 프로덕션 배포 승인은 사람이 맡는다.

2025년 METR 무작위 실험에서는 숙련된 개발자가 익숙한 코드베이스에서 최신 AI 도구를 썼는데도 작업 시간이 늘었다. AI를 붙인다고 항상 빨라지는 것은 아니다. 맡긴 일, 사용한 도구, 코드베이스 경험, 결과를 확인하는 시간에 따라 효과가 달라진다.

경영지원

회의 자료를 요약하고 결정 사항과 담당자, 기한을 뽑거나 사규와 양식을 찾는 일에 쓸 수 있다. 비용 증빙의 누락 항목을 표시하는 작업도 후보가 된다. 예외 승인과 인사·계약 판단, 실제 지급은 담당자가 맡는다.


5. AI 사용과 운영 사이에는 간격이 있다

Stanford 의 2026 AI Index에 따르면 2025년 조사 대상 조직 중 88%가 AI를 사용했다. 적어도 한 가지 업무에서 를 쓴 조직은 70%였다. 반면 업무별 AI 배치 비율은 대부분 한 자릿수였다. 세 수치는 서로 다른 범주와 문항을 측정하므로 한 단계씩 이어지는 비율처럼 비교하면 안 된다. 챗봇과 은 이미 흔하지만, 여러 작업을 스스로 이어가는 에이전트는 아직 시험 운영이 많다.

AI Index에는 고객지원 14~15%, 소프트웨어 개발 26%, 마케팅 산출 50% 등 생산성 향상을 보고한 연구가 실렸다. 절차와 결과를 비교하기 쉬운 업무에서 효과가 컸고, 깊은 이 필요한 일에서는 효과가 작았다. 장기적으로 학습 능력이 약해질 수 있다는 결과도 있었다. 연구마다 조건이 다르므로 이 숫자를 모든 조직에 그대로 대입해서는 안 된다.

Microsoft의 2026 Work Trend Index는 10개국에서 AI를 쓰는 근로자 2만 명의 설문과 Microsoft 365 사용 신호를 분석했다. 보고된 AI 효과에는 개인의 노력보다 조직 문화, 관리자 지원, 인재 제도가 약 두 배 더 큰 영향을 미쳤다. 계정 배포보다 업무 절차와 관리 방식의 변화가 더 큰 영향을 줬다는 해석이다.

순서가 정해진 자동화에는 이미 안정된 도구와 사례가 많다. 에이전트 시범 운영도 늘고 있다. 회사 전체로 넓히려면 방법, 권한 관리, 데이터 접근, 사고가 났을 때의 책임을 풀어야 한다.


6. 무엇부터 자동화할까

AI의 발전은 더 자연스러운 답변에서 끝나지 않았다. 이제는 자료를 찾고 도구를 쓰며 여러 작업을 이어서 처리한다. 모든 일을 에게 맡길 이유는 없다. 정해진 순서가 있는 일은 로 처리하고, 결과를 예측하기 어려운 일에만 에이전트를 쓰는 편이 낫다.

프롬프트보다 작업 환경을 먼저 본다

한 번 잘 쓴 프롬프트보다 어떤 자료를 읽고 무슨 도구를 쓰는지, 결과를 어떻게 확인하는지가 더 큰 영향을 준다. 지침만 적어두지 말고 테스트와 를 붙여 사람이 보기 전에 일부 오류를 잡는다.

범위가 좁은 일부터 맡긴다

모든 일을 맡는 범용 에이전트보다 입출금 공지 검색, 고객 문의 분류, 운영 브리핑 초안, 코드 마이그레이션처럼 범위와 완료 기준이 분명한 에이전트가 하기 쉽다. 자료와 권한도 필요한 만큼만 줄 수 있다.

연결 규격과 신뢰는 별개다

는 모델과 도구, 에이전트가 달라도 연결 코드를 다시 짜는 수고를 줄인다. 표준 규격을 쓴다고 상대 시스템까지 믿을 수 있는 것은 아니다. 접속 주체를 확인하고 권한을 제한하며 데이터가 어디로 갔는지 기록해야 한다.

말솜씨가 아니라 실행 결과를 잰다

에이전트가 자연스럽게 말한다고 일을 잘한 것은 아니다. 완료율, 출처 일치율, 사람이 고치는 데 걸린 시간, 재시도 비용을 잰다. 외부 시스템을 잘못 바꾼 횟수와 제때 멈추고 복구했는지도 운영 지표에 넣는다.

현업 경험으로 좋은 결과를 정의한다

AI가 실행을 더 많이 맡을수록 사람은 목표와 우선순위를 정하고 애매한 예외를 판단한다. 현업 경험은 AI가 만든 결과를 평가하고 업무 절차를 고치는 기준이 된다.

실패를 다음 시험 문제로 남긴다

성공과 실패 사례를 평가 데이터로 남기면 지침과 도구를 고칠 수 있다. 규칙을 바꾼 뒤 같은 시험을 다시 돌려 실제로 나아졌는지 확인한다. 에이전트는 한 번 설치하고 끝내는 제품이 아니라 계속 손보는 운영 시스템이다.


7. 현업 경험을 AI의 작업 기준으로 옮기는 법

처음부터 코딩을 배울 필요는 없다. 하던 일을 순서대로 나누고 어떤 결과가 좋으며 어떤 실수가 위험한지 설명하는 일이 먼저다.

  1. 업무를 입력, 판단, 행동, 검토로 나눈다.
  2. 좋은 결과와 위험한 결과를 구체적인 사례로 설명한다.
  3. 문서에 없는 예외와 암묵지를 실제 사례로 제공한다.
  4. AI가 쓸 권한과 사람이 질 책임을 구분한다.
  5. 절약한 시간뿐 아니라 수정량과 사고도 측정한다.

첫 실험은 입출금 공지 검색이나 공개 정보로 답할 수 있는 문의 분류처럼 범위가 좁은 일 하나면 충분하다. 검색, 분류, 초안 작성처럼 결과를 바로 확인할 수 있는 구간부터 맡긴다.


8. 90일 동안 작게 시험하고 넓히기

0~30일: 업무 하나를 고르고 현재 상태를 잰다

입출금 안내 문의처럼 범위가 분명한 업무를 하나 고른다. 한 달 처리량, 한 건에 걸리는 시간, 잘못된 출처를 붙인 횟수, 개인정보가 들어가는지를 적는다. AI를 쓰기 전의 시간과 품질을 남겨야 나중에 나아졌는지 비교할 수 있다. 첫 실험에는 공개 자료나 민감하지 않은 자료를 쓴다.

31~60일: 읽고 정리하는 기능만 연다

처음에는 공개 공지 검색, 문의 분류, 답변 초안처럼 외부 시스템을 바꾸지 않는 기능만 허용한다. 개인정보를 제거한 사례 30~100개로 시험 세트를 만들고 정확도, 출처 누락, 담당자가 고치는 데 걸린 시간을 함께 잰다.

61~90일: 되돌릴 수 있는 쓰기 권한만 연다

승인 전 초안을 내부 검토함에 넣는 것처럼 되돌릴 수 있는 쓰기부터 으로 연다. 고객 답변 발송, 계정 정보 조회, 공지 게시, 자산에 영향을 주는 판단은 담당자가 승인한다. 운영 화면에서는 비용, 실패율, 중단 버튼, 담당자를 바로 확인할 수 있어야 한다.

확장 전에 확인할 것


9. 용어를 다시 풀어보면

용어 어디에 쓰나
AI가 글을 읽을 때 나누는 작은 단위. 한 글자나 단어 조각일 수 있다 문장을 계산할 수 있는 단위로 바꿀 때
AI가 한 번에 참고할 수 있는 정보의 범위 긴 문서와 대화를 이어서 다룰 때
AI에게 주는 작업 요청 지금 해야 할 일을 모델에 알려줄 때
Generative AI Generative Artificial Intelligence. 글, 이미지, 음성, 코드 같은 결과물을 만드는 생성형 인공지능 분류와 예측을 넘어 새 결과물을 만들 때
글이나 자료의 의미를 숫자로 바꾼 표현 뜻이 비슷한 자료를 찾을 때
Retrieval-Augmented Generation, 검색 증강 생성. 관련 문서를 찾아 답변에 넣는 방식 최신 자료와 사내 지식을 답변에 반영할 때
미세조정. 특정 데이터로 모델의 행동을 추가 학습하는 과정 전문 작업이나 원하는 말투에 맞출 때
Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습 사람이 선호한 답을 이용해 답변 습관을 조정할 때
모델. 복잡한 문제에 더 많은 중간 계산을 쓰는 모델 계획, 수학, 코딩, 분석처럼 여러 단계가 필요한 문제를 풀 때
검색기, 계산기, , 앱을 호출하는 능력 최신 정보를 확인하거나 실제 행동을 실행할 때
미리 정한 순서대로 처리하는 자동화 반복 업무를 예측 가능한 순서로 처리할 때
목표와 현재 상황을 보고 다음 행동을 고르는 시스템 예외가 생기는 여러 단계의 업무를 처리할 때
Agentic AI 목표와 도구, 실행 순서를 결합한 AI 시스템 답변을 넘어 여러 작업을 이어서 처리할 때
실행 조율. 단계와 도구, 여러 를 관리하는 일 복잡한 실행 순서와 실패 처리를 관리할 때
실행 환경. 상태 저장과 재시도, 중단, 재개를 처리하는 부분 오래 걸리는 작업을 안정적으로 이어갈 때
Memory 과거 상태와 업무 기록을 저장해 다시 쓰는 기능 장기 작업의 상태를 이어갈 때
Model Context Protocol, 모델 컨텍스트 프로토콜 AI와 도구·데이터의 연결 방식을 맞출 때
Agent2Agent Protocol, 에이전트 간 통신 규격 서로 다른 에이전트가 작업과 결과를 주고받을 때
절차와 전문지식, 스크립트, 템플릿을 묶은 것 반복 업무의 수행 방법을 다시 쓸 때
모델을 둘러싼 실행·안전·검증 시스템 모델을 실제 업무에서 계속 운영할 때
Evaluations의 줄임말. AI 결과를 반복해서 재는 시험 출시 전후의 품질과 성능 저하를 확인할 때
개인정보 노출과 금지 행동을 막는 안전장치 정책 위반과 안전 사고를 줄일 때
관찰 가능성. 실행 과정과 실패 원인을 추적하는 기능 에이전트를 운영하고 문제를 조사할 때
중요한 판단이나 실행에 사람이 직접 개입하는 설계 책임이 크거나 되돌리기 어려운 예외를 통제할 때

10. 업무에 적용할 때 남겨둘 기준

AI와 함께 일한다는 것은 판단을 통째로 넘기는 일이 아니다. 자동화할 범위를 정하고 좋은 결과의 기준을 만든 뒤, 책임이 따르는 순간에는 사람이 확인한다. AI를 도입하면 우리가 일을 나누고 검토하는 방식도 함께 달라진다.


주요 출처

  1. Vaswani et al., Is All You Need (2017): https://arxiv.org/abs/1706.03762
  2. Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020): https://arxiv.org/abs/2005.11401
  3. Bommasani et al., On the Opportunities and Risks of Foundation Models (2021): https://arxiv.org/abs/2108.07258
  4. Ouyang et al., Training language models to follow instructions with human feedback (2022): https://arxiv.org/abs/2203.02155
  5. Wei et al., Chain-of-Thought Prompting Elicits in Large Language Models (2022): https://arxiv.org/abs/2201.11903
  6. Yao et al., : Synergizing Reasoning and Acting in Language Models (2022): https://arxiv.org/abs/2210.03629
  7. Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools (2023): https://arxiv.org/abs/2302.04761
  8. Wu et al., AutoGen: Enabling Next-Gen Applications via Conversation (2023): https://arxiv.org/abs/2308.08155
  9. Anthropic, Building Effective AI Agents (2024): https://www.anthropic.com/engineering/building-effective-agents
  10. Anthropic, Introducing the Model Context Protocol (2024): https://www.anthropic.com/news/model-context-protocol
  11. Google Developers, Announcing the Agent2Agent Protocol (2025): https://developers.googleblog.com/en/a2a-a-new-era-of-agent-interoperability/
  12. OpenAI, A practical guide to building AI agents: https://openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents/
  13. Stanford , 2026 AI Index - Economy: https://hai.stanford.edu/ai-index/2026-ai-index-report/economy
  14. Microsoft WorkLab, 2026 Work Trend Index - Agents, human agency, and the opportunity for every organization: https://www.microsoft.com/en-us/worklab/work-trend-index
  15. NIST, AI Risk Management Framework / Generative AI Profile: https://www.nist.gov/itl/ai-risk-management-framework
  16. World Economic Forum, The Future of Jobs Report 2025: https://www.weforum.org/publications/the-future-of-jobs-report-2025/
  17. METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity: https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
  18. Birgitta Böckeler / Martin Fowler, engineering for users (2026): https://martinfowler.com/articles/harness-engineering.html
  19. Yang et al., SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering (2024): https://arxiv.org/abs/2405.15793
  20. Xie et al., OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments (2024): https://arxiv.org/abs/2404.07972
  21. Anthropic, Introducing (2024): https://www.anthropic.com/news/3-5-models-and-computer-use
  22. Harness-Bench (2026 preprint): https://arxiv.org/html/2605.27922
  23. Anthropic, Demystifying for AI agents: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
  24. specification: https://agentskills.io/

출처를 읽을 때 주의할 점