연구→실무 gap — 어디까지 production에 도달했나
산업이 문제 인식에는 컨센서스에 도달했지만, 실제 production에 살아 도착한 해결책은 매우 좁다. 이 gap이 정확히 v1.0이 점유할 자리. 결론: 단순한 패턴이 production에 도달했고, 복잡한 패턴은 학술에 머물러 있다. v1.0은 simple pattern + segment fit이 답.
한 줄
OSWorld benchmark가 1년 만에 12% → 66%로 뛰었지만, 88%의 agent pilot이 production에 못 간다. Model 능력 ≠ Production 능력. production에 도달한 패턴은 단순하다 — Ralph Loop, file-based memory, named ownership. 화려한 skill RL/multi-agent orchestration은 아직 학술 SDK 단계.
산업 현실 — 데이터로 본 production gap
도달률 (가장 결정적 데이터)
| 지표 | 수치 | 출처 |
|---|---|---|
| Agent pilot이 production에 도달 | 12%만 | March 2026 enterprise survey (650 leaders) |
| Pilot 실패율 | 88% | 같음 |
| Enterprise에 at least 1개 production agent | 31% | S&P Global / McKinsey |
| Industry별: 은행/보험 | 47% | 같음 |
| Industry별: 헬스케어/정부 | 14-18% | 같음 |
| 12개월 내 positive ROI | 41% | Gartner |
| 12개월 negative ROI | 22% | 같음 |
| Agentic AI 프로젝트 cancel 예측 (2027) | 40% | Gartner |
→ 88%가 production에 못 가는 시장. 이게 v1.0의 entry surface.
Benchmark vs Production의 괴리
| Benchmark | 1년 변화 |
|---|---|
| OSWorld | 12% → 66% (인간 대비 -6%) |
| SWE-bench Verified | 60% → ~100% of human baseline |
→ Model 능력은 비약적으로 향상. 그런데 production 도달률은 12%. 이 괴리가 harness 문제의 정량화. 모델이 좋아져도 production에 못 간다는 게 시장 합의.
12% production 도달한 곳들의 공통 패턴
March 2026 survey (650 leaders) 분석에 따르면, *organization-wide scale에 성공한 12%*는 놀랍게 일관된 4가지 운영 프로필을 공유:
각 패턴의 의미:
| 패턴 | 의미 | v1.0 매핑 |
|---|---|---|
| Named Ownership | agent마다 책임자가 명확. 익명 swarm 아님 | skill·use case에 owner field 처음부터 |
| Scoped Success Criteria | "agent가 무엇을 성공한 것인가"를 명시적 spec으로 | SKILL.md frontmatter에 success criteria |
| Automated Evaluation | 사람이 매번 검토 안 함. 자동 eval이 gate | v0.x에 eval crate 처음부터 |
| Ship-and-Roll-Back | 배포·롤백을 normal operation으로. 둘 다 verdict가 아님 | sandbox + rollback (사용자 아이디어 2가 정확히 이것) |
→ 12%의 success pattern이 v1.0 design 그 자체. 우연이 아님 — 5 기둥이 향하는 곳이 production이 도달한 곳.
Production에 도달한 패턴들 — Ralph Loop이 대표
Ralph Loop — 진짜로 production에 산 패턴
Geoffrey Huntley가 만든 minimal autonomous loop pattern. 단순함이 production을 통과한 결정적 이유.
while not done:
run agent on next task
verify completion
commit (git)
rollback if failed
GitHub 채택 현황 (조사 시점):
- Vercel Labs 공식 채택 —
vercel-labs/ralph-loop-agent. AI SDK 공식 통합 - Gemini CLI 공식 extension —
gemini-cli-extensions/ralph - Cursor / Claude Code / Codex orchestration —
nitodeco/ralph - Multi-agent Ralph + MemPalace memory + 925+ tests —
alfredolopez80/multi-agent-ralph-loop - Claude Code 전용 무한 loop 안전장치 —
frankbria/ralph-claude-code - PRD 기반 task 자동 처리 —
snarktank/ralph,PageAI-Pro/ralph-loop - Minimal file-based —
iannuttall/ralph - 원조 —
ghuntley/how-to-ralph-wiggum
왜 도달했나:
- 단순 (
수십수백 줄) - file이 state (git이 history)
- verify function이 scoped success criteria 그 자체
- rollback이 normal operation
→ Ralph Loop = "12% 공통 패턴"을 단순 코드로 압축한 것.
Virtualized Filesystem — Anthropic progress file pattern
- AGENTS.md, todo.md, progress.md를 context window 밖에 두고 필요 시 read
- Context Rot 회피 + long-horizon continuity
- Anthropic이 documented, Ralph Loop 구현들이 채택
- 복잡한 RAG 없이 파일이 답
→ Production 해결책이 DB가 아니라 파일인 것이 산업 통찰.
Modular AGENTS.md / SKILL.md
- monolithic이 안 scale → 디렉토리 구조로 분리
- agentskills.io SKILL.md frontmatter
- declarative spec이 named ownership + scoped success criteria 구현
→ 표준화는 산업이 빠르게 도달.
도달하지 못한 패턴들 — 학술 SDK 단계
AutoSkill / WebRL / SkillRL — RL 기반 skill 진화
- AutoSkill: Python SDK 있음, embed 가능하지만 production product 채택 사례 거의 없음
- WebRL: 학술 framework. THUDM(ChatGLM) 연구
- SkillRL: GitHub repo 있지만 주로 reproducibility 논문 단계
- SkillEvo 1.0 (2026-03 release): self-evolving 시도, production 검증 없음
왜 못 도달했나:
- RL training cost (GPU·dataset·reward signal 설계)
- benchmark가 좁음 (WebShop 등)
- 88% pilot 실패의 cohort에 머무름
- production에서는 "이미 학습된 model + simple harness"로 충분하다는 합의
→ 사용자 아이디어 1(RL skill 생성)이 v1.x로 미뤄야 하는 정량 근거.
CAAF (Convergent AI Agent Framework)
- arxiv 2604.17025 — "Harness as an Asset: Enforcing Determinism"
- 프레임워크 제안 단계
- production 채택 사례 미발견
Multi-agent orchestration (LangGraph 등)
- complex coordination은 production에서 brittle 평가
- 시장이 single + deterministic으로 회귀
- multi-agent가 도달한 곳은 fault isolation 단위만 (Anthropic sub-agent 패턴)
시장이 비어 있는 좌표
v1.0이 점유할 자리 — 정확한 정의:
"Ralph Loop 수준의 simple pattern을, 학내 segment에 fit한 형태로, 12% production 공통 패턴 4가지(ownership · scoped success · automated eval · ship-and-rollback)를 처음부터 박아둔 harness."
→ 화려한 RL skill 진화·multi-agent orchestration·복잡한 plan-execute 안 함. simple + segment fit만으로 12% production 문턱을 넘는다.
사용자 아이디어의 시장 검증
이전 대화에서 제안한 두 아이디어를 production 데이터로 검증:
아이디어 1 — RL 기반 skill 자동 생성
| 검증 항목 | 결과 |
|---|---|
| 학술 시도 | ✅ AutoSkill, WebRL, SkillRL 활발 |
| Production 도달 사례 | ❌ 거의 없음 |
| 12% success cohort에 포함되는가 | ❌ |
| 학내 segment cost | ❌ 비현실적 |
| 결론 | v1.x로 미루고, demonstration + LLM mining으로 시작 |
아이디어 2 — Sandbox + git-like rollback
| 검증 항목 | 결과 |
|---|---|
| 학술 시도 | ✅ |
| Production 도달 사례 | ✅✅ Ralph Loop의 핵심 |
| 12% success cohort 공통 패턴인가 | ✅ "ship-and-roll-back as normal operation" |
| 학내 segment 적용 가능 | ✅ |
| 결론 | v0.8 단계에서 본격 채택, 4가지 공통 패턴의 핵심 한 축 |
→ 사용자 본능이 production data와 정확히 일치. 아이디어 2는 시장 검증 완료.
v0.x 단계 매핑 — production 도달을 향한 경로
→ 각 v0.x 단계가 12% success pattern 또는 Ralph Loop의 한 piece에 정확히 매핑. v1.0 도달 시점에 production 12%의 공통 패턴 4가지를 모두 갖춤.
결론 — v1.0의 시장 진입 근거
- 88% pilot이 production에 못 가는 시장 = entry surface가 매우 큼
- 12% 도달 패턴이 4가지로 명확 = v1.0이 직접 흡수 가능
- production 도달한 패턴은 단순 (Ralph Loop, file-based, modular spec) = 복잡한 RL/multi-agent 안 만들어도 됨
- 대기업·오픈소스 모두 segment fit이 약함 = 학내 segment에 빈 자리 있음
- 사용자 아이디어 2(sandbox + rollback)는 production data로 검증된 핵심 패턴 = v0.8 우선순위
→ v1.0의 진입 명제: "12% production pattern 4가지 + 학내 segment fit + Ralph Loop 수준의 단순함". 이 좌표는 시장이 비어 있고, 데이터로 fit이 검증된 자리.
관련
-
-
- software-fundamentals-thesis — Matt thesis
- industry-hot-issues-2026 — 시장 컨센서스 (이 노트의 짝)
- evolution-roadmap (예정) — v0.x 매핑을 12% pattern으로 재구성
- business-segment-entry (예정) — 학내 segment 진입 시나리오
Sources
- Stanford AI Index 2026 — Agents 66% Success Rate, 89% Never Reach Production (BERI)
- March 2026 Enterprise Survey — AI Agent Scaling Gap (Digital Applied)
- AI Agent Adoption 2026: 120+ Enterprise Data Points
- AI Agent Productivity Statistics 2026: 100+ ROI Data
- Enterprise AI Agents 2026: Mid-Year Report on What's Working
- Agentic AI in Production: Claude Cowork & GPT-5.4 (TechBytes)
- AI Agent Benchmarks 2026: Performance, Accuracy & Cost Compared
Ralph Loop production implementations
- ghuntley/how-to-ralph-wiggum — 원조
- vercel-labs/ralph-loop-agent — Vercel 공식
- gemini-cli-extensions/ralph — Gemini CLI 공식 extension
- nitodeco/ralph — Cursor/Claude Code/Codex orchestration
- alfredolopez80/multi-agent-ralph-loop — 925+ tests
- PageAI-Pro/ralph-loop — production-ready
- iannuttall/ralph — minimal file-based
- frankbria/ralph-claude-code — Claude Code 전용