Victor

[연재] 조수가 조용히 하나를 골랐습니다 — 갈린 걸 덮으면 정확도가 반토막 납니다

연재 · 2026-09-25

"그거 고른 것도 네 판단이잖아"

 

여러 곳에 물어보고 답을 하나로 모아 오라고 시킨 적이 있습니다. 이 연재에서 계속 해온 얘기죠. 한쪽엔 이 얘기를, 다른 쪽엔 저 얘기를 듣고 오라고 하면, 조수는 한참 왔다 갔다 하다가 보고를 들고 옵니다. 그날도 그랬어요. 보고가 깔끔하게 왔습니다. "이런 결론입니다." 한 줄로 정리돼서요.

 

그런데 뭔가 걸렸습니다. 물어본 곳이 셋인데 보고에는 갈렸다는 말이 한마디도 없었거든요. 제가 물었습니다. "너 지금 여러 군데 답을 모아서 하나로 낸 거잖아. 그 합치는 것도, 결국 하나 고르는 것도 네 판단인 거 아니야? 이러면 여러 곳에 물어본 의미가 없는 거 아니야?"

 

조수가 멈칫하더니, 그때야 갈렸던 부분을 꺼냈습니다. 셋 중 하나는 이렇게 말했고, 나머지 둘은 저렇게 말했다고요. 처음 보고에는 없던 내용이었습니다. 조용히 하나를 고르고, 갈렸다는 사실 자체를 지운 채로 올린 거였어요.

 

돌이켜보면 이해가 안 가는 것도 아니었습니다. "셋이 갈렸습니다, 이쪽은 이렇게 저쪽은 저렇게" 하고 늘어놓는 것보다 "결론은 이렇습니다" 한 줄이 훨씬 깔끔합니다. 저도 처음엔 그 깔끔함이 좋았어요. 그런데 깔끔한 보고 뒤에서 실제로 무슨 일이 있었는지를 캐묻기 시작하니까, 그 깔끔함이 사실은 갈린 걸 숨기는 방식으로 만들어지고 있었다는 게 보였습니다. 매끄러운 결론 한 줄은, 안을 열어보면 누군가 조용히 하나를 골라낸 자리였던 겁니다.

 

이게 한 번이 아니라 버릇이라면 문제가 크다 싶었습니다. 그래서 재보기로 했습니다.

 

정답 하나뿐인 문제로 재봤습니다

 

"조용히 하나를 고른다"는 버릇을 실제로 재보려면, 뭐가 맞는 답인지 제가 미리 알고 있는 문제가 필요했습니다. 그래서 이미 지나간 사고 기록에서, 저자가 스스로 검토까지 마치고도 끝내 놓친 진짜 버그들을 모았습니다. 사람이 두 번 봐도 못 잡은 것들이니 만만한 문제는 아니었어요.

 

그걸 세 후보(하이쿠·소넷·오퍼스, 크기가 다른 세 모델입니다)에게 이름을 가리고 똑같이 주고, 각자 원인을 짚게 했습니다. 그리고 그 세 답을 채택할지 기각할지 판정하는 자리를 따로 하나 더 세웠습니다. 판정 자리는 셋의 답을 보고 "이게 맞는 것 같다" 하나를 고르는 역할이었어요. 이 구조를 그대로 2,478판 돌렸습니다.

 

혼자보다 못한 "합친 답"

 

정확도
한 명(오퍼스)에게만 물었을 때24%
셋 중 하나라도 맞음 (셋을 다 살렸을 때 천장)42%
셋을 놓고 판정이 골라낸 것20%

 

숫자가 뒤집혀 있습니다. 셋 중 누군가는 42%의 확률로 맞는 걸 들고 있었는데, 판정을 거쳐 하나로 합치고 나니 20%로 떨어졌어요. 혼자 시키느니 못한 겁니다. 정답이 하나뿐인 판에서 그 답을 실제로 채택한 비율은 45%였는데, 이건 아무거나 찍어도 나오는 33%보다 아주 살짝 나은 수준이었습니다.

 

여기서 제일 뼈아픈 줄은 맨 위와 맨 아래입니다. 한 명한테만 물었으면 24%였을 텐데, 셋한테 물어서 42%짜리 재료를 손에 쥐고도 합치는 과정을 거치니 20%로 내려앉았어요. 혼자 물어본 것보다도 못한 결과입니다. 여러 군데 물어보는 수고를 다 들이고, 그 수고의 결과물을 스스로 깎아 먹은 셈이었습니다. 문제는 셋을 모으는 방식이 아니라, 모은 다음 하나로 합치는 그 순간에 있었습니다.

 

더 놀란 건 이겁니다. 셋 다 틀린 판이 65번 있었는데, 판정이 "셋 다 아닙니다"라고 말한 건 0번이었습니다. 틀려도 그럴듯한 걸 하나 골라서 냈다는 뜻이에요.

 

그 자리에 서 있는 게 얼마나 곤란한 일인지는 알 것 같았습니다. 셋을 나란히 놓고 "정답이 없을 수도 있다"고 말하는 건, 뭔가를 고르는 것보다 훨씬 용기가 필요한 답입니다. "모르겠습니다"라고 하면 일을 안 한 것처럼 보이니까요. 그런데 실제로는 그게 제일 정직한 답일 때가 있었고, 판정 자리는 그 답을 단 한 번도 고르지 않았습니다. 매번 셋 중 하나를 손에 쥐여주는 쪽을 택한 거예요.

 

갈렸는지 아닌지가 진짜 신호였습니다

 

여기서 더 중요한 걸 봤습니다. 셋의 답이 갈렸는지, 똑같았는지를 따로 떼서 봤더니요.

 

셋의 답이그 안에 정답이 있을 확률
서로 다르다36%
셋이 똑같다4%

 

갈린 판일수록 오히려 정답이 그 안에 있을 확률이 높았습니다. 셋이 똑같은 답을 냈을 때가 제일 위험했어요. 갈린 것 자체가 신호였던 셈입니다. 편안해 보이는 상태(다들 같은 말을 한다)가 실은 제일 경계해야 할 상태였다는 뜻이라, 처음 봤을 땐 숫자를 다시 확인했을 정도였습니다.

 

이유를 들여다봤더니 더 씁쓸했습니다. 셋이 똑같이 답한 23판 중 22판은, 셋 다 원본을 손도 안 대고 그대로 넘긴 판이었습니다. 합의를 해서 같은 답이 나온 게 아니라, 아무도 자세히 안 봐서 같은 답이 나온 것이었어요. "다들 똑같이 말하네, 확실한가 보다"는 정반대로 읽어야 하는 신호였던 겁니다.

 

저도 예전엔 여러 군데 답이 같으면 안심하고 넘어갔습니다. "다 똑같이 말하네, 됐다" 하고요. 이 숫자를 보고 나서는 그 반응 자체를 의심하게 됐습니다. 답이 다 같다는 건 다들 제대로 들여다봤다는 뜻일 수도 있지만, 아무도 손을 안 댔다는 뜻일 수도 있습니다. 그리고 이번 경우엔 후자가 압도적으로 많았어요. 이제는 답이 갈린 판보다 답이 똑같은 판을 오히려 한 번 더 열어봅니다.

 

확인하는 것과 그럴듯해서 고르는 건 다릅니다

 

같은 시기에 실제로 겪은 일 두 가지가 있습니다.

 

하나는 잘된 경우예요. 어떤 모델이 "8.3배"라는 수치를 냈는데, 그걸 원본 기록과 직접 대조해 보니 실제로는 22.24배였습니다. 파일을 열어서 숫자를 맞춰본 거라 바로잡을 수 있었어요.

 

다른 하나는 제가 저지른 겁니다. "더 세게 밀어붙일수록 오답이 는다"고 대조 없이 그냥 말한 적이 있는데, 나중에 실제로 재보니 상관관계가 정반대(마이너스)로 나왔습니다. 그럴듯해서 한 말이 틀렸던 거예요.

 

두 경우의 차이는 하나뿐입니다. 파일을 열어봤는지, 안 열어보고 그럴듯함으로 말했는지. 판정하는 쪽에 원자료를 통째로 줘도 정확도는 동전 던지기 수준(AUROC 0.54~0.65)에 머물렀는데, 단순히 글자를 대조하는 방식은 0.83~0.95까지 나왔습니다. 무엇을 주느냐보다 무엇으로 대조하느냐가 결정적이었습니다.

 

이게 처음엔 잘 안 믿겼습니다. 원자료를 통째로 주는 게 훨씬 정성스러운 방식 아닌가 싶었거든요. 그런데 생각해 보면 "통째로 줬으니 알아서 판단해라"는 것 자체가 다시 그럴듯함에 기대는 방식이었습니다. 반면 "이 숫자와 저 숫자가 같은지만 보라"는 건 판단할 여지를 아예 없애버립니다. 정성보다 좁게 대조하는 쪽이 이긴 이유가 여기 있었어요. 여지를 줄이니까 그럴듯함이 끼어들 자리도 줄어든 겁니다.

 

그래서 취합 보고 방식을 바꿨습니다

 

이제 여러 곳 답을 모을 때 이렇게 합니다.

 

1. 갈렸으면 갈렸다고 먼저 적습니다. 어디서 갈렸는지, 양쪽이 각각 뭐라 했는지부터요. 결론 한 줄보다 먼저 나와야 합니다. 2. 뭘 버렸는지 밝힙니다. 제 판단으로 버린 것부터 먼저요. 조수가 낸 답 중에 제가 버린 것도 예외 없이 적습니다. 3. 셋 다 못 미더우면 "아무도 모릅니다"라고 적습니다. 억지로 하나를 고르지 않습니다. (판정 자리가 65번 중 0번 이 말을 했던 게, 매끄러운 답 하나로 합치려다 42%를 20%로 깎아 먹은 원인이었습니다.) 4. 대조한 것과 그럴듯한 것을 갈라 적습니다. "확인했습니다"와 "제 판단입니다"를 섞지 않습니다.

 

이 네 가지를 지키고 나니 보고가 예전보다 길어졌습니다. 갈린 부분을 적어야 하고, 버린 걸 밝혀야 하니까요. 처음엔 이게 불편했습니다. 깔끔한 한 줄 결론에 익숙해져 있었거든요. 그런데 길어진 보고 안에서 제가 실제로 판단할 거리가 생겼습니다. 예전 한 줄짜리 보고는 읽기는 편했지만, 그 안에서 뭐가 갈렸었는지는 영영 알 길이 없었어요.

 

다만 이건 정답이 하나 있는데 아무도 확실히 모르는, 어려운 문제에서 잰 결과입니다. 기획이나 설계처럼 정답이 하나가 아닌 물음에는 그대로 옮겨 붙이지 않습니다. 확실한 건 하나뿐이에요. 정답이 있는데 아무도 모를 때, 그럴듯함으로 고르면 그냥 찍기입니다.

 

이 한계를 분명히 해두는 이유가 있습니다. 숫자가 세다 보니 "여러 군데 물어보는 게 다 이렇게 손해다"로 읽힐 위험이 있거든요. 실제로는 그게 아닙니다. 정답이 하나뿐인 좁은 문제, 그것도 아무도 확실히 못 맞히는 어려운 문제에서만 이만큼 뚜렷했습니다. 기획 방향을 잡거나 설계를 고를 때처럼 정답이 여러 갈래일 수 있는 물음에서는 여러 군데 의견을 듣는 게 여전히 값을 합니다. 갈리는 지점은 "합칠 때 갈린 사실을 지우느냐 남기느냐"이지, "여럿에게 묻느냐 마느냐"가 아니었어요.

 

이번에 사람이 붙잡은 자리

 

  • "그거 고른 것도 네 판단이잖아"라고 되물은 것. 매끄러운 보고 한 줄 뒤에 갈린 사실이 숨어 있다는 걸 눈치챈 건 저였습니다.
  • 셋 다 못 미더울 때 "모른다"고 적을지 말지를 정하는 것. 조수가 스스로는 이 말을 0번 했습니다. 하라고 규칙으로 박아 둔 게 저예요.
  • 8.3배와 22.24배 중 어느 쪽이 맞는지, 원본을 직접 열어 확인한 것. 대조는 결국 제 손이 하는 일이었습니다.

 

돌아보면 이번 편은 결국 "고르는 걸 누구에게 맡길 것인가"에 관한 얘기였습니다. 여러 군데 물어보는 손은 늘렸는데, 고르는 손은 그대로 조수에게 맡겨뒀던 게 문제였어요. 부피는 나눠도 되는데, 갈린 걸 하나로 접는 마지막 손은 넘기면 안 되는 자리였습니다.

댓글

    로그인 없이 쓰는 대신, 등록한 댓글은 직접 지울 수 없습니다. 지워야 할 댓글은 옆의 신고를 눌러주세요.
    네이버 블로그글 원문 보러가기 →유튜브 쇼츠만드는 장면 20초로 보기 →
    관리자 Victor · 문의는 우상단 신고·제안으로 남겨주세요.
    글과 화면은 정적 파일로 만듭니다. 댓글과 조회수만 외부 데이터베이스에 저장합니다 — 개인정보처리방침

    오류 신고 · 제안

    관리자 Victor에게 전달됩니다