research

연구→실무 gap — 어디까지 production에 도달했나

연구→실무 gap — 어디까지 production에 도달했나

산업이 문제 인식에는 컨센서스에 도달했지만, 실제 production에 살아 도착한 해결책은 매우 좁다. 이 gap이 정확히 v1.0이 점유할 자리. 결론: 단순한 패턴이 production에 도달했고, 복잡한 패턴은 학술에 머물러 있다. v1.0은 simple pattern + segment fit이 답.


한 줄

OSWorld benchmark가 1년 만에 12% → 66%로 뛰었지만, 88%의 agent pilot이 production에 못 간다. Model 능력 ≠ Production 능력. production에 도달한 패턴은 단순하다 — Ralph Loop, file-based memory, named ownership. 화려한 skill RL/multi-agent orchestration은 아직 학술 SDK 단계.


산업 현실 — 데이터로 본 production gap

도달률 (가장 결정적 데이터)

지표수치출처
Agent pilot이 production에 도달12%만March 2026 enterprise survey (650 leaders)
Pilot 실패율88%같음
Enterprise에 at least 1개 production agent31%S&P Global / McKinsey
Industry별: 은행/보험47%같음
Industry별: 헬스케어/정부14-18%같음
12개월 내 positive ROI41%Gartner
12개월 negative ROI22%같음
Agentic AI 프로젝트 cancel 예측 (2027)40%Gartner

88%가 production에 못 가는 시장. 이게 v1.0의 entry surface.

Benchmark vs Production의 괴리

Benchmark1년 변화
OSWorld12% → 66% (인간 대비 -6%)
SWE-bench Verified60% → ~100% of human baseline

→ Model 능력은 비약적으로 향상. 그런데 production 도달률은 12%. 이 괴리가 harness 문제의 정량화. 모델이 좋아져도 production에 못 간다는 게 시장 합의.


12% production 도달한 곳들의 공통 패턴

March 2026 survey (650 leaders) 분석에 따르면, *organization-wide scale에 성공한 12%*는 놀랍게 일관된 4가지 운영 프로필을 공유:

각 패턴의 의미:

패턴의미v1.0 매핑
Named Ownershipagent마다 책임자가 명확. 익명 swarm 아님skill·use case에 owner field 처음부터
Scoped Success Criteria"agent가 무엇을 성공한 것인가"를 명시적 spec으로SKILL.md frontmatter에 success criteria
Automated Evaluation사람이 매번 검토 안 함. 자동 eval이 gatev0.x에 eval crate 처음부터
Ship-and-Roll-Back배포·롤백을 normal operation으로. 둘 다 verdict가 아님sandbox + rollback (사용자 아이디어 2가 정확히 이것)

12%의 success pattern이 v1.0 design 그 자체. 우연이 아님 — 5 기둥이 향하는 곳이 production이 도달한 곳.


Production에 도달한 패턴들 — Ralph Loop이 대표

Ralph Loop — 진짜로 production에 산 패턴

Geoffrey Huntley가 만든 minimal autonomous loop pattern. 단순함이 production을 통과한 결정적 이유.

while not done:
    run agent on next task
    verify completion
    commit (git)
    rollback if failed

GitHub 채택 현황 (조사 시점):

  • Vercel Labs 공식 채택vercel-labs/ralph-loop-agent. AI SDK 공식 통합
  • Gemini CLI 공식 extensiongemini-cli-extensions/ralph
  • Cursor / Claude Code / Codex orchestrationnitodeco/ralph
  • Multi-agent Ralph + MemPalace memory + 925+ testsalfredolopez80/multi-agent-ralph-loop
  • Claude Code 전용 무한 loop 안전장치frankbria/ralph-claude-code
  • PRD 기반 task 자동 처리snarktank/ralph, PageAI-Pro/ralph-loop
  • Minimal file-basediannuttall/ralph
  • 원조ghuntley/how-to-ralph-wiggum

왜 도달했나:

  • 단순 (수십수백 줄)
  • file이 state (git이 history)
  • verify function이 scoped success criteria 그 자체
  • rollback이 normal operation

Ralph Loop = "12% 공통 패턴"을 단순 코드로 압축한 것.

Virtualized Filesystem — Anthropic progress file pattern

  • AGENTS.md, todo.md, progress.md를 context window 밖에 두고 필요 시 read
  • Context Rot 회피 + long-horizon continuity
  • Anthropic이 documented, Ralph Loop 구현들이 채택
  • 복잡한 RAG 없이 파일이 답

→ Production 해결책이 DB가 아니라 파일인 것이 산업 통찰.

Modular AGENTS.md / SKILL.md

  • monolithic이 안 scale → 디렉토리 구조로 분리
  • agentskills.io SKILL.md frontmatter
  • declarative spec이 named ownership + scoped success criteria 구현

→ 표준화는 산업이 빠르게 도달.


도달하지 못한 패턴들 — 학술 SDK 단계

AutoSkill / WebRL / SkillRL — RL 기반 skill 진화

  • AutoSkill: Python SDK 있음, embed 가능하지만 production product 채택 사례 거의 없음
  • WebRL: 학술 framework. THUDM(ChatGLM) 연구
  • SkillRL: GitHub repo 있지만 주로 reproducibility 논문 단계
  • SkillEvo 1.0 (2026-03 release): self-evolving 시도, production 검증 없음

왜 못 도달했나:

  • RL training cost (GPU·dataset·reward signal 설계)
  • benchmark가 좁음 (WebShop 등)
  • 88% pilot 실패의 cohort에 머무름
  • production에서는 "이미 학습된 model + simple harness"로 충분하다는 합의

→ 사용자 아이디어 1(RL skill 생성)이 v1.x로 미뤄야 하는 정량 근거.

CAAF (Convergent AI Agent Framework)

  • arxiv 2604.17025 — "Harness as an Asset: Enforcing Determinism"
  • 프레임워크 제안 단계
  • production 채택 사례 미발견

Multi-agent orchestration (LangGraph 등)

  • complex coordination은 production에서 brittle 평가
  • 시장이 single + deterministic으로 회귀
  • multi-agent가 도달한 곳은 fault isolation 단위만 (Anthropic sub-agent 패턴)

시장이 비어 있는 좌표

v1.0이 점유할 자리 — 정확한 정의:

"Ralph Loop 수준의 simple pattern을, 학내 segment에 fit한 형태로, 12% production 공통 패턴 4가지(ownership · scoped success · automated eval · ship-and-rollback)를 처음부터 박아둔 harness."

→ 화려한 RL skill 진화·multi-agent orchestration·복잡한 plan-execute 안 함. simple + segment fit만으로 12% production 문턱을 넘는다.


사용자 아이디어의 시장 검증

이전 대화에서 제안한 두 아이디어를 production 데이터로 검증:

아이디어 1 — RL 기반 skill 자동 생성

검증 항목결과
학술 시도✅ AutoSkill, WebRL, SkillRL 활발
Production 도달 사례❌ 거의 없음
12% success cohort에 포함되는가
학내 segment cost❌ 비현실적
결론v1.x로 미루고, demonstration + LLM mining으로 시작

아이디어 2 — Sandbox + git-like rollback

검증 항목결과
학술 시도
Production 도달 사례✅✅ Ralph Loop의 핵심
12% success cohort 공통 패턴인가✅ "ship-and-roll-back as normal operation"
학내 segment 적용 가능
결론v0.8 단계에서 본격 채택, 4가지 공통 패턴의 핵심 한 축

사용자 본능이 production data와 정확히 일치. 아이디어 2는 시장 검증 완료.


v0.x 단계 매핑 — production 도달을 향한 경로

→ 각 v0.x 단계가 12% success pattern 또는 Ralph Loop의 한 piece에 정확히 매핑. v1.0 도달 시점에 production 12%의 공통 패턴 4가지를 모두 갖춤.


결론 — v1.0의 시장 진입 근거

  1. 88% pilot이 production에 못 가는 시장 = entry surface가 매우 큼
  2. 12% 도달 패턴이 4가지로 명확 = v1.0이 직접 흡수 가능
  3. production 도달한 패턴은 단순 (Ralph Loop, file-based, modular spec) = 복잡한 RL/multi-agent 안 만들어도 됨
  4. 대기업·오픈소스 모두 segment fit이 약함 = 학내 segment에 빈 자리 있음
  5. 사용자 아이디어 2(sandbox + rollback)는 production data로 검증된 핵심 패턴 = v0.8 우선순위

v1.0의 진입 명제: "12% production pattern 4가지 + 학내 segment fit + Ralph Loop 수준의 단순함". 이 좌표는 시장이 비어 있고, 데이터로 fit이 검증된 자리.


관련


Sources

Ralph Loop production implementations

학술 단계 (production 미도달)