# AI 대중화 이후의 에이전틱 전환 — Son 전략 보고서

**기준일:** 2026-08-11  
**판단 대상:** 일반 대중의 AI 보급이 대화형 사용에서 작업 위임·에이전틱 실행으로 넘어가고 있는지, 그리고 Son이 어떤 제품·운영 역량을 선점해야 하는지  
**결론 신뢰도:** 중상. 대중 생성형 AI 보급은 비교 가능한 시계열이 있지만, 일반 인구의 ‘에이전트 사용률’은 아직 공통 정의와 연속 시계열이 없다. 따라서 대중 보급·플랫폼 행태·기업 도입을 분리해 삼각측량했다.

![에이전틱 전환 숫자 인포그래픽](agentic-transition-infographic.png)

> **한 줄 결론:** 생성형 AI의 관심과 체험은 이미 대중 시장에 진입했지만, 에이전틱 전환은 ‘완전자율’이 아니라 **사람이 승인하고 시스템이 실행·검증·복구하는 통제형 위임** 단계에 있다. Son이 팔아야 할 것은 에이전트 캐릭터나 멀티에이전트 숫자가 아니라 **검증 가능한 작업 완료율**이다.

---

## 1. 숫자로 본 현재 위치

### 1.1 대중 보급: 관심은 대중화, 습관은 초기 다수층

Reuters Institute가 아르헨티나·덴마크·프랑스·일본·영국·미국의 성인을 대상으로 같은 구조로 수행한 조사에서, 13개 생성형 AI 도구 중 하나 이상을 들어본 비율은 **2024년 78%에서 2025년 90%**로 증가했다. 한 번이라도 사용한 비율은 **40%에서 61%**, 주 1회 이상 사용은 **18%에서 34%**로 늘었다. 연도별 총 표본은 약 12,000명이다.

| 6개국 성인 | 2024 | 2025 | 변화 |
|---|---:|---:|---:|
| 하나 이상의 AI 도구 인지 | 78% | 90% | +12%p |
| 한 번 이상 사용 | 40% | 61% | +21%p |
| 주 1회 이상 사용 | 18% | 34% | +16%p |

한국 NIA 인터넷이용실태조사의 생성형 AI 서비스 경험률은 **2023년 17.9% → 2024년 33.3% → 2025년 44.5%**로 증가했다. 2년간 **2.49배**, **+26.6%p**다. 2025년 조사는 전국 22,500가구와 가구 내 만 3세 이상 상주 가구원을 대상으로 한 방문면접 국가승인통계다.

**판단:** ‘AI를 아는가’는 이미 보편화 단계다. 그러나 ‘매주 쓰는가’는 3명 중 1명이고, 한국의 경험률도 아직 과반 직전이다. Son의 일상처럼 에이전트를 상시 운영하는 층은 대중 평균이 아니라 선도 사용자층이다.

### 1.2 작업 위임: 플랫폼 내부에서는 이미 의미 있는 비중

OpenAI의 실제 ChatGPT 사용 연구는 약 110만 개 표본 대화를 분류했다. 2025년 6월 말 메시지 의도는 **Asking 51.6%, Doing 34.6%, Expressing 13.8%**였다. 여기서 Doing은 글 작성, 계획 작성, 프로그래밍 등 사용자가 결과물을 생성하도록 요구하는 행동이다.

Anthropic Economic Index는 약 100만 개 Claude.ai Free/Pro 대화를 O*NET 직무 과업에 매핑했다. 직업 관련 사용에서 **증강 57%, 자동화 43%**로 분류됐다.

| 실제 플랫폼 행태 | 수치 | 무엇을 뜻하는가 | 뜻하지 않는 것 |
|---|---:|---|---|
| ChatGPT Doing | 34.6% | 답변 소비가 아니라 산출물·작업 수행 의도 | 외부 시스템에서 끝까지 자율 실행된 비율이 아님 |
| Claude 자동화 | 43% | 직무 과업을 AI가 직접 수행한 대화 분류 | 일반 인구의 자동화 채택률이 아님 |

**판단:** 사용자는 이미 ‘질문’에서 ‘일 시키기’로 이동하고 있다. 하지만 Doing과 자동화는 에이전트가 브라우저·파일·API를 사용해 최종 상태까지 책임졌다는 뜻이 아니다. 현재 공개 데이터에서 가장 큰 측정 공백이 바로 **요청→행동→검증→완료**의 끝단이다.

### 1.3 기업 도입: 실험은 넓지만 운영 확장은 매우 좁다

Capgemini Research Institute는 14개국의 디렉터급 이상 리더 1,500명을 조사했고, 응답자가 단순 AI 어시스턴트가 아닌 AI 에이전트를 답했는지 900명에게 재확인했다.

| 기업 에이전트 도입 단계 | 2025 |
|---|---:|
| 전면 확장 | **2%** |
| 부분 확장 | **12%** |
| 파일럿 | **23%** |
| 6~12개월 내 실험·배포 준비 | 31% |
| 잠재력 탐색 | 30% |
| 관심 없음 | 1% |

파일럿 이상은 37%지만 부분·전면 확장은 14%, 전면 확장은 2%뿐이다. McKinsey의 2025 글로벌 조사에서도 조직의 **62%가 AI 에이전트를 최소한 실험 중**이라고 답해 ‘관심과 실험의 폭’은 교차 확인된다. 다만 두 조사는 표본과 문항이 다르므로 수치를 직접 연결하지 않는다.

더 중요한 것은 신뢰다. Capgemini 조사에서 완전자율 AI 에이전트를 신뢰한다는 조직은 12개월 전 **43%에서 27%로 하락**했다. 반면 **90%는 AI 워크플로에서 사람의 개입이 긍정적이거나 비용 중립적**이라고 봤다.

이 요구는 기업만의 현상이 아니다. Pew Research Center의 2025년 미국 조사에서 일반 성인의 **55%**, AI 전문가의 **57%**가 자신의 삶에서 AI가 사용되는 방식에 대해 더 많은 통제권을 원했다. 일반 성인은 AI 확산에 ‘우려보다 기대가 크다’는 응답이 11%에 그쳤고, **51%는 기대보다 우려가 크다**고 답했다. 이는 글로벌 보급률이 아니라 미국의 태도 조사이므로 별도 신뢰 신호로만 사용한다.

**판단:** 에이전틱 전환은 실패한 유행이 아니다. 실험 속도가 신뢰·관찰성·권한·복구 체계보다 빨라서, ‘더 자율적인 모델’보다 **더 통제 가능한 하네스**가 부족한 시장이다.

### 1.4 전망은 강하지만 관측치와 분리해야 한다

Gartner는 기업 소프트웨어 애플리케이션 중 에이전틱 AI를 포함하는 비율이 **2024년 1% 미만에서 2028년 33%**로 증가할 것으로 전망한다. 이는 실제 도입률이 아니라 예측이다. 방향성 신호로만 사용해야 하며, 2028년 수치를 현재 TAM처럼 계산하면 안 된다.

---

## 2. 에이전틱 전환의 실체

‘에이전틱’은 이분법이 아니다. 실제 시장은 다음 연속선에 있다.

1. **답변:** 모델이 텍스트·이미지를 반환한다.
2. **산출:** 사용자가 명시한 문서·코드·계획을 만든다.
3. **도구 사용:** 파일, 브라우저, API, 코드 실행으로 외부 상태를 읽는다.
4. **승인형 위임:** 에이전트가 계획과 변경안을 제시하고 사람이 실행을 승인한다.
5. **검증형 실행:** 실행 후 테스트·상태 확인·증거 영수증을 남긴다.
6. **제한 자율:** 정해진 권한·예산·시간·샌드박스 안에서 반복 실행한다.
7. **완전자율:** 사람의 중간 승인 없이 고위험 의사결정과 변경까지 수행한다.

현재 대중 시장은 1~3, 선도 사용자와 기업 파일럿은 3~5, 실제 확장 기업은 5~6에 있다. 7은 기술 데모와 마케팅에서 과대표현되지만 신뢰 수치는 오히려 하락했다.

에이전트 성능도 모델 하나의 속성이 아니다. 실사용 결과는 **모델 + 컨텍스트 + 메모리 + 도구 + 런타임 + 권한 + 평가 + 관찰성 + 복구**의 구성에서 결정된다. Son의 Hermes 실험실은 단순히 모델을 호출하는 곳이 아니라 이 구성 전체를 운영하는 하네스 실험장이라는 점에서 시장보다 앞서 있다.

---

## 3. Son에게 생긴 전략적 기회

### 3.1 시장 포지션

**피해야 할 포지션:** “무엇이든 알아서 하는 범용 멀티에이전트”  
**잡아야 할 포지션:** “특정 작업을 승인 가능하고 검증 가능하게 끝내는 운영 시스템”

일반인은 ‘에이전틱 AI’를 구매하지 않는다. 다음을 구매한다.

- 장애 원인을 좁히고 안전한 변경안을 제시하는 것
- 조사 출처를 모아 의사결정 보고서를 완성하는 것
- 반복 개발 작업을 실제 파일·테스트·빌드까지 끝내는 것
- 실패했을 때 무엇이 바뀌었고 어떻게 되돌릴지 알 수 있는 것

따라서 제품 화면의 중심은 채팅창이 아니라 **작업 상태, 승인 대기, 변경 diff, 검증 결과, 비용, 복구 버튼, 최종 산출물**이어야 한다.

### 3.2 Son 적합도 기준 우선순위

아래 점수는 외부 시장 통계가 아니라 Son의 현재 역량과 실행 가능성을 평가한 Sonia 전략 점수다. 가중치는 기술 적합 30%, 문제 강도 25%, 지불 가능성 20%, 시연 가능성 15%, 안전한 제품화 10%다.

| 후보 | 전략 점수 / 5 | 판단 |
|---|---:|---|
| **검증형 Ops Agent** | **4.55** | SRE·DevOps 경력, 실제 상태 검증과 롤백이 차별화 요소. 1순위 |
| Research-to-Decision Operator | 4.05 | 현재 Hermes 조사·HTML 보고서 파이프라인과 결합하기 쉽고 빠른 유료 파일럿 가능 |
| Game Production Operator | 3.60 | 강한 데모와 개인 적합성이 있으나 고객군과 지불 구조가 상대적으로 좁음 |

### 3.3 1순위 제품 가설: Evidence-first SRE Change Agent

**고객:** 엔지니어 3~20명의 소규모 SaaS·인디 개발팀, 전담 SRE·플랫폼팀 없이 GitHub Actions와 제한된 배포 스택을 운영하는 곳  
**첫 작업:** 실패한 CI 입력 → 로그·코드 read-only 분석 → 원인 가설·근거 → 수정 브랜치/PR → 테스트 결과 → 잔여 위험·롤백 계획이 포함된 `Change Packet`  
**하지 않는 것:** 기본 브랜치 직접 커밋, 승인 없는 운영환경 변경, 범용 셸 접근, 무제한 재시도, ‘성공했다’는 모델 자기보고

첫 웨지를 프로덕션 헬스체크 복구가 아니라 **Failed CI Diagnosis → Fix PR → Verification Log**로 잡는 이유는, 실제 파일·테스트·PR이라는 검증 가능한 결과물을 만들면서도 프로덕션 쓰기 권한 없이 품질과 시간 절감을 측정할 수 있기 때문이다.

권장 작업 계약:

```text
ChangePacket
├── problem_statement
├── evidence[]
├── hypotheses[]
├── proposed_diff
├── tests_run[]
├── residual_risks[]
├── approval_request
├── rollback_plan
└── provenance_log
```

실행 흐름은 `Prepare → Preview → Approve → Execute → Verify`로 고정한다. 승인 패킷에는 실제 명령·예상 diff·비용과 시간 상한·권한 범위·검증 방법·만료시간·롤백을 함께 넣는다. 단순히 위험한 도구 호출마다 묻는 방식은 승인 피로만 만든다.

이 계약은 Hermes에서 Sonia가 이미 지향하는 intake → routing → verification → review → report 구조와 맞는다. 다중 프로필은 고객에게 파는 기능이 아니라 Planner·Executor·Verifier의 권한과 컨텍스트를 분리하는 내부 하네스로 사용한다.

---

## 4. 90일 실행 전략

### 0~30일: Shadow Mode에서 결과 품질을 증명

1. 첫 작업은 **Failed CI Diagnosis → Fix PR → Verification Log** 하나로 제한한다.
2. GitHub 접근은 read-only 분석과 별도 브랜치/PR 쓰기로 제한하고, 기본 브랜치·배포 권한은 주지 않는다.
3. 5개 저장소의 과거 CI 실패 50건을 replay해 고정 평가셋으로 만든다.
4. 모든 실행에서 동일한 Change Packet과 계획, 근거, diff, 테스트, 비용, 복구 가능 여부를 기록한다.
5. ‘모델 응답이 그럴듯함’이나 자기보고 속도감이 아니라 실제 테스트 통과와 검토자의 수락으로 채점한다.

**Go 게이트(권장 목표):** 50건 중 검증 가능한 Change Packet 35건 이상, 중대한 허위 근거 0건, 비용·실행·출처 로그 누락 0건, 무단·범위 외 변경 0건.

### 31~60일: 승인형 실행과 복구로 확장

1. 3~5개 실제 팀에서 GitHub Issue/PR 안에 같은 작업을 제공한다.
2. 모든 쓰기 작업은 승인형으로 유지하고, capability를 작업·리소스·시간별로 제한한다.
3. 승인 패킷에 명령, diff, 권한, 비용 상한, 만료시간, 롤백을 함께 표시한다.
4. 재시도 상한, 인간 에스컬레이션, 체크포인트 재개를 구현한다.
5. 사용자가 수정한 계획·거부한 명령·롤백한 실행을 구조화된 평가 데이터로 남긴다.
6. 모델 비교보다 하네스 비교를 먼저 수행한다: 컨텍스트, 도구 인터페이스, 승인 시점, 검증 방식의 변화가 수락률과 완료율에 미치는 영향을 본다.

**Go 게이트(권장 목표):** 무단·범위 외 변경 0건, 승인 후 실행 성공률 90% 이상, 가역적 실패 롤백 성공률 100%, 검토 시간 중앙값 10분 이하.

### 61~90일: 결과 기반 상품으로 포장

1. ‘AI 에이전트 구독’이 아니라 월별 **검증 완료 작업 묶음**으로 가격을 제시한다.
2. 무료 데모는 읽기 전용 진단까지, 유료는 승인형 실행·검증·감사 로그까지 제공한다.
3. 고객별 환경 커넥터를 무작정 늘리지 말고, 가장 반복되는 2~3개 스택만 지원한다.
4. 실패 사례와 복구 과정을 숨기지 않고 신뢰 자산으로 공개한다.

**상품화 기준:** 반복 고객 3곳 이상, 주간 재사용률 50% 이상, 작업당 공헌이익 양수, 동일 실패의 재발률 감소.

---

## 5. 운영 KPI — 에이전트가 아니라 완료 시스템을 측정

### 북극성 지표

**Weekly Verified Accepted Outcomes (WVAO)**  
`검토자가 근거와 검증을 확인하고 실제 업무에 반영한 Change Packet의 주간 수`

WVAO는 고객 가치와 반복 사용을 보는 상업 지표다. 시스템 신뢰성은 별도로 **Verified Task Completion Rate (VTCR)**, 즉 `사용자가 승인한 목표 중 실제 환경 상태 검증과 증거 영수증까지 통과한 비율`로 관리한다.

### 필수 보조 지표

| 영역 | 지표 |
|---|---|
| 결과 | 실제 완료율, 부분 완료율, 재작업률 |
| 신뢰 | 잘못된 성공 보고율, 사람의 계획 수정률, 승인 거부율 |
| 안전 | 권한 위반 차단률, 롤백 성공률, 비가역 변경 건수 |
| 경제성 | 작업당 토큰·도구 비용, 사람 개입 시간, 작업당 공헌이익 |
| 운영 | 평균 완료시간, 타임아웃률, 재시도 횟수, 상태 복구시간 |
| 학습 | 동일 실패 재발률, 평가셋 회귀율, 환경별 성공률 |

단순 메시지 수, 생성 토큰, 에이전트 수, 툴 호출 수는 북극성 지표가 아니다. 많을수록 비용과 실패면이 커질 수 있다.

---

## 6. 하지 말아야 할 것

1. **일반인 에이전트 보급률을 한 숫자로 발명하지 말 것.** 현재 대중·플랫폼·기업 지표는 모집단과 정의가 다르다.
2. **멀티에이전트를 기본값으로 두지 말 것.** 분업이 검증 가능성과 총 성공률을 높일 때만 사용한다.
3. **완전자율을 마케팅 선두에 놓지 말 것.** 신뢰는 43%에서 27%로 떨어졌다.
4. **채팅 UI를 제품 전체로 착각하지 말 것.** 승인·diff·상태·증거·롤백이 핵심 인터페이스다.
5. **범용 커넥터부터 늘리지 말 것.** 한 작업의 완료 계약을 먼저 고정한다.
6. **에이전트 자기보고를 성공으로 채점하지 말 것.** 파일, 테스트, HTTP, DB, 배포 상태를 읽어 검증한다.

---

## 7. 최종 판단

에이전틱 AI는 ‘다음에 올 것’이 아니라 이미 사용행태와 기업 실험에서 시작됐다. 그러나 보급곡선은 대화형 AI와 다르다.

- 대중 인지: **90%** — 이미 대중화
- 대중 주간 사용: **34%** — 초기 다수층
- 플랫폼 내 Doing/자동화: **34.6~43%** — 작업 위임이 의미 있는 비중
- 기업 파일럿 이상: **37%** — 실험 확산
- 부분·전면 확장: **14%** — 운영 병목
- 전면 확장: **2%** — 아직 초기
- 완전자율 신뢰: **43%→27%** — 통제 요구 증가

그러므로 Son의 기회는 모델 경쟁이 아니라 **신뢰 가능한 에이전트 운영 계층**이다. Hermes 실험실에서 이미 축적한 라우팅, 도구 사용, 승인 경계, 검증, 보고, 프로필 분리를 하나의 좁은 결과 계약으로 압축하면 된다.

**다음 행동 하나:** 앞으로 30일 동안 ‘검증형 Ops Agent’의 단일 작업을 정하고, 실제 과업 20개짜리 평가셋과 VTCR 대시보드를 먼저 만든다. 제품 이름과 캐릭터는 그 다음이다. 낭만은 남겨도 되지만, 완료 증거보다 먼저 팔면 그냥 예쁜 자동화 사고예요.

---

## 출처

1. [Reuters Institute, Generative AI and News Report 2025](https://reutersinstitute.politics.ox.ac.uk/sites/default/files/2025-10/Gen_AI_and_News_Report_2025.pdf)
2. [NIA, 인터넷이용실태조사 자료 목록](https://www.nia.or.kr/site/nia_kor/ex/bbs/List.do?cbIdx=99870)
3. [OpenAI Economic Research, How People Use ChatGPT](https://cdn.openai.com/pdf/a253471f-8260-40c6-a2cc-aa93fe9f142e/economic-research-chatgpt-usage-paper.pdf)
4. [Anthropic, The Anthropic Economic Index](https://www.anthropic.com/news/the-anthropic-economic-index)
5. [Capgemini Research Institute, Rise of agentic AI](https://www.capgemini.com/wp-content/uploads/2025/07/AI-Agents_Final_160725.pdf)
6. [McKinsey, The State of AI 2025](https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai)
7. [Gartner, Three predictions for the future of GenAI](https://www.gartner.com/en/articles/3-bold-and-actionable-predictions-for-the-future-of-genai)
8. [Anthropic, Building effective agents](https://www.anthropic.com/engineering/building-effective-agents)
9. [Pew Research Center, How the U.S. Public and AI Experts View Artificial Intelligence](https://www.pewresearch.org/internet/2025/04/03/how-the-us-public-and-ai-experts-view-artificial-intelligence/)
