AI 협업에서 판단력을 유지하는 워크플로우
여러 창에서 AI 에이전트에게 동시에 코딩·리서치 정리·경쟁사 분석을 맡기면 산술적으로는 생산성이 배로 늘어야 하지만, 실제로는 결과물을 받아 들고 "이게 진짜 괜찮은 건지, 그럴듯해 보여서 괜찮다고 느끼는 건지" 구분이 안 되는 경험이 흔하다. Microsoft Research·CMU가 지식노동자 319명의 실제 생성형 AI 업무 사례 936건을 수집한 연구는 이 현상의 원인을 짚는다 — AI에 대한 신뢰가 높을수록 비판적 사고를 덜 했다고 보고한 반면, 해당 과업을 스스로 수행할 수 있다는 자신감이 높을수록 비판적 사고를 더 많이 했다. 문제는 위험이 낮아 보이는 일상적 작업일수록 전자(신뢰에 기댄 채 검증을 건너뛰는 태도) 쪽으로 기울기 쉽고, 이 습관이 쌓이면 정작 중요한 결정 앞에서도 "이 결과물이 맞나"를 묻는 감각이 무뎌진다는 점이다.
이 어려움은 Microsoft Research가 이름 붙인 production-to-evaluation shift(생성에서 평가로의 이동)로 설명된다. 사람이 직접 와이어프레임을 그리면 정보 구조·시선 흐름·우선순위를 정하는 과정이 자기 안에서 일어나 맥락을 그대로 갖고 있지만, AI가 완성된 결과를 주면 그 의도를 결과에서 거꾸로 추론해야 한다 — 같은 결과물이어도 보유한 맥락의 양이 다르기 때문에 검수가 훨씬 힘들어진다. 1978년 Slamecka와 Graf가 제시한 Generation effect(직접 생성한 단어가 읽기만 한 단어보다 더 잘 회상되는 현상)도 같은 원리를 뒷받침한다 — 나중에 떠올리기 쉬워서가 아니라, 만드는 순간 자체가 더 깊은 인지 처리를 일으키기 때문이다. 실제로 52명의 소프트웨어 개발자가 새 라이브러리를 학습하는 실험에서 AI 사용 집단과 비사용 집단의 과제 완료 시간은 비슷했지만, 후속 이해도 평가는 AI 사용 집단 평균 50%, 직접 코딩 집단 67%로 갈렸다. AI 사용 집단 내부에서도 코드 생성·오류 해결을 전적으로 위임한 유형은 24~39%에 그친 반면, 코드 생성 후 작동 원리를 되묻거나 개념만 AI에 물어 직접 구현한 유형은 65~86%를 기록했다 — 즉 프롬프트를 잘 쓰는 기술보다 AI의 작업 과정에 어떤 방식으로 관여했는가가 이해도를 가른다.
CHI 2025에서 발표된 투자 포트폴리오 실험(참가자 21명)은 이 관여 방식의 효과를 직접 비교한다. 버튼을 누르면 AI가 바로 추천안을 주는 RecommendAI를 쓴 그룹은 결정 직후 자신감이 86%로 높았지만 실제 결과를 본 뒤 만족도는 43%로 급락한 반면, 먼저 자기 논리를 글로 쓰면 AI가 그 위에 피드백을 얹는 ExtendAI를 쓴 그룹은 자신감 67%·만족도 67%로 거의 일치했다 — 먼저 논리를 세운 쪽은 결과가 어떻든 자기 판단 수준을 정확히 인지하기 때문이라는 것이 연구진의 해석이다.
이 연구들을 종합해 제안하는 실천 워크플로우는 다섯 단계다. ① 의도 먼저 적기 — AI에게 요청을 보내기 전 기대하는 결과를 2~3줄로 적어, 나중에 결과물을 "뭘 기준으로 볼 것인가"를 미리 남긴다. ② 기다리는 시간에 합격 기준 쓰기 — UC Berkeley의 EvalGen 연구(UIST 2024)가 보고한 criteria drift(결과물을 채점하며 기준 자체가 수정되는 현상)를 고려해, AI가 도는 동안 다른 작업으로 넘어가지 않고 합격/불합격 기준을 적어보되 기준이 바뀌면 왜 바뀌었는지도 함께 기록한다. ③ 핵심 부분 직접 재현하기 — 전체를 다시 만들 필요 없이 판단이 가장 중요한 한 구간만 골라 자기 버전을 짧게라도 써보며 맥락을 다시 심는다. ④ 기준 변화를 로그로 쌓기 — 대화가 끝난 시점에 기준이 어떻게 v1→v2→v3로 진화했는지 요약해두면, 다음 유사 작업의 프롬프트로 재사용할 수 있고 자신의 판단이 진화하는 과정도 추적할 수 있다. ⑤ 병렬은 "일" 단위가 아니라 "콘텍스트" 단위로 제한하기 — Sophie Leroy가 밝힌 attention residue(이전 작업이 끝나지 않은 채 넘어가면 주의력 일부가 남아 다음 작업 성과가 떨어지는 현상)에 따르면, 같은 사용자·같은 맥락을 잇는 작업들의 병렬 처리는 전환 비용이 적지만 전혀 다른 프로젝트를 동시에 다루면 판단력이 쉽게 무너진다.
이 워크플로우를 관통하는 결론은 "작업을 판단하고 기준을 만드는 것은 AI의 능력이 아니라 사람의 전문성"이라는 것이다. 인용된 연구들에서 더 나은 결과를 낸 사람은 프롬프트를 잘 쓴 사람이 아니라 자기 분야에 자신감이 있던 사람, 먼저 논리를 세운 사람, AI 결과물에 "왜?"를 물을 줄 아는 사람이었다. 이 역량은 사용자를 관찰하고 정보 구조를 판단해온 경험에서 나오며, AI를 쓰더라도 "왜 이렇게 만들었는지"를 설명할 수 있는 능력이 쌓이는 것이 이 워크플로우가 정의하는 생산성이다.
핵심 내용
- MS/CMU 연구(936건 실사례): AI 신뢰 ↑ → 비판적 사고 ↓, 반대로 과업 자신감 ↑ → 비판적 사고 ↑
- production-to-evaluation shift: AI가 사람의 역할을 '직접 만드는 사람'에서 '결과를 평가하는 사람'으로 이동시키며, 역설적으로 평가의 인지 부하는 오히려 커짐
- Generation effect(Slamecka & Graf, 1978): 직접 생성한 내용이 읽기만 한 내용보다 더 깊이 처리되고 더 잘 기억됨
- 개발자 52명 실험: AI 전적 위임 유형 이해도 24~39% vs "왜?"를 묻고 직접 구현한 유형 65~86% — 프롬프트 기술보다 관여 방식이 이해도를 가름
- CHI 2025 ExtendAI/RecommendAI 실험: 완성 추천을 받은 그룹은 자신감(86%)-만족도(43%) 괴리, 자기 논리를 먼저 세운 그룹은 자신감·만족도가 67%로 일치
- 실천 워크플로우 5단계: ① 의도 먼저 적기 ② 기다리는 동안 합격 기준 쓰기(criteria drift 고려) ③ 핵심 부분 직접 재현 ④ 기준 변화 로그화 ⑤ 병렬은 "콘텍스트 단위"로 제한(attention residue)
- 결론: AI 활용의 핵심 변수는 프롬프트 기술이 아니라 본업에 대한 사람의 판단력이며, "왜 이렇게 만들었는지" 설명 능력이 복리로 쌓이는 것이 진정한 생산성
관련 개념
- AI 에이전트 시대의 개발자 역할 — AI가 쏟아내는 결과물 속에서 판단력이 핵심 경쟁력이 된다는 문제의식을 공유
- 프롬프트 엔지니어링의 변화 — "AI에게 명령하는 능력"보다 "결과를 판단하는 능력"이 중요해진다는 흐름과 맞닿음
- AI 코딩 도구 활용 — Cursor·Copilot 등 실제 AI 코딩 도구 활용 맥락에서 이 워크플로우가 적용되는 구체적 현장
- 화면 설계서 작성법 — SpecSaver가 채택한 human-in-the-loop·[확인 필요] 설계가 같은 AI 과신뢰(overreliance) 문제의식을 제품 차원에서 구현한 사례
출처
- AI와 협업하는 최선의 워크플로우 찾기 — 2026-08-06, Yejin.lee