컨텍스트 스위칭의 외주화

코드는 에이전트가 쓰는데, 탭을 옮길 때마다 상황을 다시 파악하는 일은 여전히 내 몫이다.

다섯 개의 작업대가 각자 일을 진행하고, 그 요약이 선을 타고 한 사람에게 모이는 일러스트

터미널 탭이 다섯 개 열려 있다. 각 탭에서 에이전트 하나가 코드를 쓴다. 1번 탭의 diff를 승인하고, 3번 탭이 던진 질문에 답하고, 5번 탭이 테스트를 깨뜨린 것을 확인하고 다시 1번 탭으로 돌아온다. 각 탭의 작업은 계속 진행되는데, 나는 돌아갈 때마다 어디까지 이야기했는지부터 다시 확인한다.

코드는 에이전트가 쓰는데, 탭을 옮길 때마다 상황을 다시 파악하는 일은 여전히 내 몫이다. 무엇을 부탁했는지, 어디까지 결정했는지, 지금 왜 내 답이 필요한지 떠올려야 한다. 작업을 외주하면 이런 부담도 함께 줄어들 것 같았는데, 실행을 맡기는 것만으로는 충분하지 않았다.

무엇을 외주했는가

여러 작업을 직접 처리할 때 사람은 작업 사이를 오간다. 신경과학은 후측 외측 전전두피질에서 두 개의 의사결정을 동시에 처리하지 못하는 병목을 fMRI로 보여 주었다.1 여러 작업에 관한 판단을 동시에 하고 있다고 느껴도, 실제로는 주의를 빠르게 전환하고 있는 것이다.

이런 전환에는 비용이 따른다. 작업을 바꾼 직후에는 느려지고 더 많이 틀린다. 산술 문제를 번갈아 풀게 한 실험에서 전환 한 번에 평균 600밀리초 안팎이 사라졌고, 곱셈과 나눗셈을 번갈아 수행하는 조건에서는 그 손실이 1초를 넘기기도 했다.2

더 성가신 것은 그다음에 일어나는 일이다. 다른 일로 넘어가도 이전 작업에 대한 생각이 머릿속에 남아 다음 일의 성과를 떨어뜨린다. 이것을 주의 잔류라고 부른다. 일을 끝냈다고 해서 잔류가 사라지지도 않는다. 시간에 쫓기며 마무리했을 때만 잔류가 뚜렷하게 줄었고, 여유롭게 끝낸 경우에는 아예 끝내지 못한 경우와 잔류 수준이 거의 같았다.3

전환 뒤에 이런 영향이 남는데, 실제 업무에서는 전환 자체도 자주 일어난다. 정보 노동자 24명을 700시간 넘게 따라다니며 기록한 연구를 보면, 이들은 하나의 업무 영역에 평균 11분밖에 머물지 못하고 다른 영역으로 넘어갔다.4

에이전트마다 작업을 맡기면 내가 다른 일을 하는 동안에도 각 작업은 진행된다. 직접 코드를 쓰다가 다른 작업으로 넘어갔다가 다시 돌아와 이어 쓰는 일을 줄일 수 있다. 멀티 에이전트는 사람이 번갈아 실행하던 작업을 실제로 병렬로 진행해 준다.

그러나 실행이 계속된다고 해서 사람이 그 작업으로 돌아갈 일이 없어지는 것은 아니다. 질문과 결과가 도착하면, 이번에는 판단하고 검토하기 위해 돌아가야 한다.

작업에 돌아올 때마다 맥락을 다시 파악한다

예를 들어 한 에이전트가 두 구현 중 어느 쪽을 선택할지 묻는다. 답하려면 코드만 읽어서는 부족하다. 처음 요청한 목적, 앞서 합의한 제약, 다른 작업과의 관계를 다시 확인해야 한다. 다른 탭에서도 질문이 오면 같은 과정을 반복한다. 각 에이전트는 자기 작업을 이어 가지만, 사람은 여러 작업의 맥락을 번갈아 복원한다.

이때 드는 부담은 결과를 검토하는 시간과도 구분할 필요가 있다. 한 작업의 코드를 오래 읽는 일도 어렵지만, 탭을 바꿀 때마다 왜 이 코드를 검토해야 하는지부터 다시 떠올리는 일은 추가 부담이다. 실행을 맡겼어도, 각 작업에 다시 주의를 기울일 때 필요한 준비는 사람에게 남을 수 있다.

1983년에 Lisanne Bainbridge가 쓴 「자동화의 아이러니」는 자동화 뒤에도 사람이 해야 할 일이 남는다고 지적했다.5 직접 처리하던 일을 시스템에 맡기면, 그 작동을 감독하고 문제가 생겼을 때 넘겨받아야 한다. 자동화된 시스템의 감독을 다룬 연구에서도 시스템 감시에만 집중할 때는 고장 탐지율이 97%에 이르렀지만, 다른 수동 작업을 함께 수행하면 고장을 놓치기 쉬워졌다.6 여러 에이전트의 질문과 결과를 오가며 판단하는 상황에서도 이런 주의 분산을 경계할 필요가 있다.

코드 자체를 이해하는 일도 없어지지 않는다. 학생 9명에게 오류가 있는 AI 생성 코드를 검증하고 수정하게 한 예비 연구에서는, 과제 시간의 85.7%가 코드 이해 단계로 분류됐다.7 작은 실험이고 작업 간 전환 비용을 측정한 것도 아니다. 다만 코드를 이미 받았다고 해서 곧바로 판단할 수 있는 것은 아니라는 점은 보여 준다. 작업의 목적과 제약을 떠올리는 부담에, 결과 자체를 이해하는 부담도 더해진다.

따라서 무엇을 에이전트에게 맡길지에 더해, 언제 어떤 상태로 사람에게 판단을 요청할지도 정해야 한다. 사람이 매번 이전 대화를 다시 읽으며 상황을 복원해야 한다면, 실행을 외주하고도 탭을 오가는 부담은 크게 달라지지 않을 수 있다.

그러면 무엇을 할 것인가

사람이 돌아가야 할 작업의 수, 질문에 담긴 맥락, 검토할 대상과 기준, 개입 시점을 함께 바꿔 볼 수 있다. 아래는 관련 연구를 참고해 에이전트 작업에 적용해 볼 제안이다.

동시에 맡길 범위를 정한다

로봇 여러 대를 한 사람이 원격으로 감독하는 실험에서, 가장 좋은 성과가 나온 조건은 한 사람이 4대에서 6대를 맡았을 때였다.8 6대에서 8대로 늘려도 수집량은 더 늘지 않았고, 제한 시간 안에 회수하지 못한 로봇은 늘었다. 에이전트의 적정 개수를 이 실험에서 정할 수는 없다. 실행 중인 세션 수와 함께, 그중 몇 개가 동시에 사람의 판단을 필요로 하는지도 봐야 한다. 여러 작업에서 질문이 한꺼번에 오면 그만큼 서로 다른 맥락을 다시 파악해야 한다.

질문에 필요한 맥락을 함께 전달하게 한다

질문을 받을 때마다 이전 대화를 다시 읽고 있다면, 질문에 포함할 내용을 정해 볼 수 있다. 작업 목적, 이미 합의한 제약, 현재 상태, 선택지와 필요한 결정을 함께 전달하게 한다. 예를 들어 “어느 쪽으로 할까요?”라는 질문에 “호환성을 유지해야 하는데 두 방법 중 하나는 기존 호출 방식을 바꿉니다”라는 설명이 붙으면 무엇을 판단해야 하는지 분명해진다. 질문을 읽는 동안 판단에 필요한 맥락도 파악할 수 있어야 한다. 요약의 길이보다 지금 판단하는 데 필요한 정보가 있는지가 중요하다.

검토할 대상과 기준을 정한다

악성 행동을 숨기는 에이전트의 기록을 AI가 검사하고, 의심 사례만 사람이 재검토한 실험이 있다. AI는 사람이 구체적인 증거를 제시할 때만 최초 판정을 바꾸도록 했다. 두 조건을 함께 적용하자 탐지율은 AI 단독의 20.6%에서 36.2%로 높아졌다.9 대상을 줄이는 데 더해 검토 의견을 반영하는 기준까지 정한 결과다. 이를 참고해 자동 검토 결과 중 어떤 경우에 사람에게 질문할지, 어떤 근거를 함께 전달할지 정해 볼 수 있다. 사람이 전체 기록을 처음부터 읽기 전에 검토 대상과 이유를 알 수 있게 하는 것이다.

개입하는 시점을 정한다

과제를 수행하는 도중에 방해를 받은 사람은 과제와 과제 사이의 경계에서 받은 사람보다 오류를 두 배로 냈다.10 알림을 하루 몇 차례로 묶어 받게 한 현장 실험에서는 집중력과 기분이 나아졌다는 결과도 있다. 다만 이 개선은 자기보고이며, 객관적인 작업 성과가 좋아졌다는 결과는 아니었다.11 이를 참고해 즉시 결정해야 작업을 이어 갈 수 있는 질문과 나중에 확인해도 되는 보고를 구분할 수 있다. 급하지 않은 보고는 묶어서 받고, 작업의 한 덩어리가 끝난 뒤에 검토하는 방법을 시도해 볼 만하다.

외주가 부담을 줄였는지 확인한다

개입 방식을 바꿨다면 실제로 무엇이 달라졌는지 확인해야 한다. 완료 시간과 재작업률에 더해, 작업 도중 몇 번 개입했는지, 이전 대화를 얼마나 다시 읽었는지, 다른 일에 얼마나 오래 집중할 수 있었는지를 기록해 볼 수 있다. 완료 시간만으로 드러나지 않는 사람의 부담도 확인하자는 것이다. 작업은 빨라졌어도 사람이 계속 호출된다면, 실행을 맡기는 방식에는 여전히 개선할 부분이 있다.

완료 시간이 비슷해도 사람이 다른 일에 오래 집중할 수 있게 됐다면 외주의 의미가 있을 수 있다. 속도와 오류, 사람의 개입 부담을 함께 봐야 맡기는 방식이 나아졌는지 판단할 수 있다.

이런 변화도 체감만으로 판단하기는 어렵다. AI 보조로 작업 시간이 줄거나 처리량이 늘어난 연구도 있다.1213 반대로 2025년 METR 실험에서는 참가자들이 빨라졌다고 느꼈지만 실제 완료 시간은 늘었다. 후속 연구는 개선 가능성을 시사했으나 선택편향 때문에 개선 폭을 확정하기 어려웠다.14 이 연구들이 맥락 복원 부담을 직접 측정한 것은 아니다. 다만 외주의 효과를 체감만으로 판단하지 말아야 할 이유는 보여 준다.

개입이 줄어든 만큼 오류를 놓치고 있지는 않은지도 함께 봐야 한다. 침해를 누가 먼저 발견했는지 구분하는 Mandiant의 집계처럼,15 검토에서 발견한 오류와 검토를 통과한 뒤 드러난 오류를 나누어 기록할 수 있다.

맺으며

목적과 제약, 결과의 근거를 함께 전달받으면 이전 대화를 전부 다시 읽지 않고도 판단을 시작할 수 있다. 필요한 것은 내가 이미 아는 것과 연결해 이해할 수 있는 설명이다. 검증과 수정에 더해, 그 설명을 준비하는 과정도 에이전트에게 맡길 수 있다.

에이전트가 일을 계속한다고 해서 내가 그 일을 다시 이해해야 하는 순간까지 없어지지는 않는다. 외주의 효과는 얼마나 많은 실행을 맡겼는지뿐 아니라, 사람이 언제 어떤 맥락을 받아 판단하는지에도 달려 있다. 에이전트를 더 늘리기 전에, 내가 매번 모든 탭을 돌아다니며 상황을 다시 파악해야 하는 이유부터 살펴볼 필요가 있다.


각주


  1. Dux, P. E., Ivanoff, J., Asplund, C. L., & Marois, R. (2006). "Isolation of a Central Bottleneck of Information Processing with Time-Resolved fMRI." Neuron, 52(6), 1109–1120. https://doi.org/10.1016/j.neuron.2006.11.009 ↩

  2. Rubinstein, J. S., Meyer, D. E., & Evans, J. E. (2001). "Executive Control of Cognitive Processes in Task Switching." Journal of Experimental Psychology: Human Perception and Performance, 27(4), 763–797. https://doi.org/10.1037/0096-1523.27.4.763. 산술 과제를 쓴 두 실험의 평균 전환 비용은 653밀리초와 614밀리초다. 다만 덧셈·뺄셈 조건은 29~508밀리초, 곱셈·나눗셈 조건은 776~1,265밀리초로 복잡도에 따라 크게 벌어진다. 널리 인용되는 "멀티태스킹이 생산성을 40% 떨어뜨린다"는 수치는 이 논문에 없다. ↩

  3. Leroy, S. (2009). "Why Is It So Hard to Do My Work? The Challenge of Attention Residue When Switching Between Work Tasks." Organizational Behavior and Human Decision Processes, 109(2), 168–181. https://doi.org/10.1016/j.obhdp.2009.04.002. 참가자 162명을 대상으로 한 두 건의 실험이다. 주의 잔류와 후속 과제의 성과를 서로 다른 참가자 집단에서 측정했기 때문에, 저자는 둘 사이의 매개 관계를 직접 검증하지는 못했다고 밝혔다. ↩

  4. Mark, G., González, V. M., & Harris, J. (2005). "No Task Left Behind? Examining the Nature of Fragmented Work." Proceedings of the SIGCHI Conference on Human Factors in Computing Systems (CHI '05), 321–330. https://doi.org/10.1145/1054972.1055017. 금융 IT 아웃소싱 기업 한 곳의 매니저·애널리스트·개발자 24명을 13개월에 걸쳐 관찰했고, 정확한 값은 11분 4초다. 저자들은 여러 도구를 다루며 동시에 여러 업무를 처리하는 기업에만 결과를 일반화할 수 있다고 밝혔다. ↩

  5. Bainbridge, L. (1983). "Ironies of Automation." Automatica, 19(6), 775–779. https://doi.org/10.1016/0005-1098(83)90046-8 ↩

  6. Parasuraman, R., & Manzey, D. H. (2010). "Complacency and Bias in Human Use of Automation: An Attentional Integration." Human Factors, 52(3), 381–410. https://doi.org/10.1177/0018720810376055. 선행 연구를 종합한 리뷰 논문이며 자체 실험을 수행하지는 않았다. 본문의 97% 는 이 논문이 인용한 Parasuraman, Molloy, & Singh (1993) 에서 단일 과제 조건의 고장 탐지율로 보고된 값이다. ↩

  7. Tang, N., Chen, M., Ning, Z., Bansal, A., Huang, Y., McMillan, C., & Li, T. J.-J. (2023). "An Empirical Study of Developer Behaviors for Validating and Repairing AI-Generated Code." PLATEAU Workshop (13th Annual Workshop at the Intersection of PL and HCI). https://toby.li/files/plateau23-tang-copilot.pdf. 85.7% 는 개발 도구 사용 기록을 연구자가 이해·탐색·편집 단계로 분류해 산출한 값이며, 시선 추적으로 잰 값이 아니다. 저자들은 이 연구를 예비 연구로 규정하며 참가자 구성과 과제 종류의 대표성이 제한적이라고 밝혔다. ↩

  8. Crandall, J. W., & Cummings, M. L. (2007). "Developing Performance Metrics for the Supervisory Control of Multiple Robots." Proceedings of the ACM/IEEE International Conference on Human-Robot Interaction (HRI '07), 33–40. https://doi.org/10.1145/1228716.1228722. 참가자 12명이 로봇 2·4·6·8대 조건에서 미로 속 물체를 찾아 출구로 옮기는 과제를 수행했다. 로봇을 6대에서 8대로 늘리면 수집한 물체 수는 더 늘지 않은 반면 잃어버린 로봇 수는 계속 증가했다. ↩

  9. Kale, N., Zhang, C. B. C., Zhu, K., Aich, A., Rodriguez, P., Scale Red Team, Knight, C. Q., & Wang, Z. (2025). "Reliable Weak-to-Strong Monitoring of LLM Agents." arXiv:2508.19461. https://arxiv.org/abs/2508.19461. 거짓양성률을 1% 로 고정했을 때의 탐지율 기준이다. 모델 단독은 20.6%, 전수 검토는 4.9%, 선별 검토에 사람이 구체적 증거를 제시하지 않으면 AI가 최초 판정을 유지하도록 하는 지시를 결합한 조건은 36.2% 로 나타났다. 기록을 1차로 채점하는 주체는 언어 모델이고 사람은 그 판정과 근거를 검증하는 역할을 맡았다. ↩

  10. Bailey, B. P., & Konstan, J. A. (2006). "On the Need for Attention-Aware Systems: Measuring Effects of Interruption on Task Performance, Error Rate, and Affective State." Computers in Human Behavior, 22(4), 685–708. https://doi.org/10.1016/j.chb.2005.12.009. 참가자 50명이 30초 안팎의 짧은 사무 과제를 수행하는 동안 방해를 받는 시점을 조작한 실험이다. 저자들은 실험에 쓴 과제들이 서로 독립적이었기 때문에, 하나의 큰 작업에 속한 하위 과제였다면 결과가 달라졌을 수 있다고 밝혔다. ↩

  11. Fitz, N., Kushlev, K., Jagannathan, R., Lewis, T., Paliwal, D., & Ariely, D. (2019). "Batching Smartphone Notifications Can Improve Well-Being." Computers in Human Behavior, 101, 84–94. https://doi.org/10.1016/j.chb.2019.07.016. 참가자 237명을 평소대로 받기, 매시간 묶어 받기, 하루 세 차례 묶어 받기, 아예 받지 않기의 네 조건에 무작위로 배정했다. 알림을 아예 끈 조건은 오히려 불안이 높게 나타났다. ↩

  12. Fan, G., Liu, D., Pan, L., & Zhang, R. (2026). "When Help Hurts: Verification Load and Fatigue with AI Coding Assistants." Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), Article 733, 1–25. https://doi.org/10.1145/3772318.3791176. 참가자 60명을 대상으로 한 통제 실험이다. 작업부하는 미국 항공우주국이 만든 RAW NASA-TLX 로 측정했다. 정신적 요구와 시간적 요구, 노력, 좌절 네 항목을 0점에서 100점 사이로 답하게 해 평균한 값이며, 논문은 5점에서 10점 정도만 차이가 나도 사람이 알아차린다고 밝혔다. 감소치는 18.2점이었고, 완료 시간은 32.1분에서 25.0분으로 약 22% 줄었다. 제목이 가리키듯 이 연구는 AI 보조의 효용보다 검증 부하를 다룬다. 과제 세 개를 연달아 수행하는 동안 피로는 AI 조건에서 0.70점, 대조군에서 0.48점 늘었고, 실패 횟수와 첫 컴파일까지 걸린 시간, 수정량 등으로 구성한 검증 부하 지수가 그 증가분의 약 26% 를 설명했다. 스트레스도 같은 방향이었으나 통계적으로 유의하지는 않았다. ↩

  13. Cui, K. Z., Demirer, M., Jaffe, S., Musolff, L., Peng, S., & Salz, T. (2026). "The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers." Management Science (온라인 사전 게재, 2026-02-27). https://doi.org/10.1287/mnsc.2025.00535. 마이크로소프트, 액센츄어, 익명의 포춘 100대 제조기업의 개발자 4,867명을 대상으로 한 실험들을 종합했다. 도구를 사용한 개발자의 주당 풀 리퀘스트 처리량이 약 26% 늘어난 것으로 추정됐다. 기업별 실험의 추정치를 정밀도로 가중해 평균한 값이다. 기업별로 보면 마이크로소프트의 27.38% 만 통계적으로 유의했고, 액센츄어(17.94%)와 익명 기업(54.03%)은 유의하지 않았다. ↩

  14. Becker, J., Rush, N., Barnes, B., & Rein, D. (METR, 2025). "Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity." arXiv:2507.09089. https://arxiv.org/abs/2507.09089. 초기 연구는 숙련된 오픈소스 개발자 16명이 익숙한 저장소의 실제 작업 246개를 수행하도록 하고, 작업별로 AI 사용을 무작위로 허용하거나 금지했다. 참가자들은 시작 전에 완료 시간이 24% 줄어들 것으로 예상했고, 실험 뒤에도 20% 줄었다고 추정했지만, 실제로는 19% 늘었다. 이 증가는 통계적으로 유의했다. 후속 추적은 논문 대신 METR 의 블로그 글 "We are Changing our Developer Productivity Experiment Design"(2026-02-24)으로 공개되었다. https://metr.org/blog/2026-02-24-uplift-update/. 기존 참가자 중 다시 참여한 10명의 완료 시간은 18% 줄어든 것으로 추정됐지만 통계적으로 유의하지 않았다. METR은 선택편향 때문에 개선 폭을 정확히 추정하기 어렵다고 밝혔다. 다만 이 편향은 AI의 효과를 과소평가할 가능성이 있으며, 연구진도 이전보다 속도 개선이 커졌을 가능성이 높다고 보았다. ↩

  15. Mandiant (2025). M-Trends 2025 Report, 13쪽 "Global Detection by Source". https://services.google.com/fh/files/misc/m-trends-2025-en.pdf. 2024년 1월 1일부터 12월 31일까지 수행한 사고 대응 조사를 집계한 자료이며, 설문 응답에 기반한 값이 아니다. 탐지 출처는 내부 43%, 외부 기관 통보 43%, 공격자 통보 14% 로 나뉜다. 표본이 Mandiant 에 사고 대응을 의뢰한 조직으로 한정된다는 점은 감안해야 한다. 이 통계는 각 조직의 탐지 체계나 AI 코드 검토의 효과를 평가한 결과가 아니다. 본문에서는 탐지 출처를 구분해 집계하는 방식을 참고했다. ↩

Subscribe to Eric's Blog

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe