기본 콘텐츠로 건너뛰기

[엑셀]UNIQUE 함수의 원리 — 중복 제거는 결국 집합(set) 만들기다

 고객 명단 5,000줄에서 실제 고객이 몇 명인지 세야 한다면, 가장 먼저 무엇을 해야 할까? 그냥 행 개수를 세면 안 된다. 같은 고객이 여러 번 주문했다면 이름이 여러 번 반복해서 나타날 것이기 때문이다. 이럴 때 필요한 것이 '중복 제거'이고, 엑셀에서는 UNIQUE 함수가 이 역할을 맡는다. 그런데 "중복을 제거한다"는 이 작업은, 사실 수학에서 아주 오래전부터 다뤄온 집합(set)이라는 개념과 정확히 같은 일이다.

집합이라는 개념부터 다시 떠올려보기

수학에서 집합은 "같은 원소가 두 번 들어갈 수 없는 모음"으로 정의된다. {사과, 사과, 바나나}라는 목록이 있어도, 이것을 집합으로 표현하면 {사과, 바나나}가 된다. 중복된 사과는 한 번만 존재하는 것으로 취급되기 때문이다. 엑셀의 고객 명단도 똑같다. "홍길동"이라는 이름이 열 번 등장하든 한 번 등장하든, 집합의 관점에서는 "홍길동"이라는 원소 하나로 취급되어야 실제 고객 수를 정확히 셀 수 있다.

UNIQUE의 동작 원리

=UNIQUE(A2:A5000)

이 수식은 A2:A5000 범위를 위에서부터 훑으면서, 처음 등장하는 값은 결과에 포함시키고 이미 한 번 나온 값과 같은 값이 다시 나타나면 결과에서 제외하는 방식으로 동작한다. 결과는 스필로 펼쳐지므로, 원본 범위에 몇 개의 고유값이 있는지 미리 알 필요 없이 있는 그대로 결과가 아래로 채워진다. 실제 고객 수가 필요하다면 이 결과를 COUNTA로 한 번 더 감싸면 된다.

=COUNTA(UNIQUE(A2:A5000))

UNIQUE와 COUNTIF, 같은 문제를 푸는 두 가지 접근

UNIQUE가 등장하기 전에는 중복 여부를 확인할 때 주로 COUNTIF를 사용했다.

  1. =COUNTIF(A:A,A2)>1 — A2와 같은 값이 A열에 2개 이상 있는지 '판정'만 해준다. 목록 자체를 만들어주지는 않는다.
  2. =UNIQUE(A2:A5000) — 중복을 제거한 목록 자체를 새로 만들어서 보여준다.

즉 COUNTIF는 "이 값이 중복인가?"라는 질문에 참/거짓으로 답하는 함수였고, UNIQUE는 그 질문의 결과를 활용해 아예 중복 없는 새 목록을 만들어내는 함수다. 목적이 '판정'이냐 '생성'이냐에 따라 선택이 달라진다고 볼 수 있다.

중복 제거 방식의 옵션 — 완전히 겹치는 것만, 아니면 한 번이라도 나온 것만

UNIQUE에는 두 번째, 세 번째 인수가 있어 세밀한 조정이 가능하다. UNIQUE(범위, FALSE, TRUE)처럼 세 번째 인수를 TRUE로 주면, 범위 안에서 딱 한 번만 등장한 값만 걸러낼 수도 있다. 이는 "정확히 한 번 주문한 신규 고객만 찾고 싶다"는 것처럼, 단순 중복 제거와는 다른 질문에 답할 때 유용하다.

자주 하는 실수

  • 대소문자나 공백 차이를 다른 값으로 인식하지 못하는 경우: "홍길동"과 "홍길동 "(끝에 공백)은 사람 눈에는 같아 보여도 UNIQUE는 서로 다른 값으로 취급해 둘 다 결과에 남긴다. TRIM 함수로 먼저 정리해두는 것이 안전하다.
  • 여러 열을 동시에 넣었을 때의 기준을 착각하는 경우: UNIQUE(A2:B100)처럼 두 열을 함께 넣으면, 두 열의 조합 전체가 같아야 중복으로 판단한다. 한 열만 기준으로 삼고 싶다면 그 열만 따로 참조해야 한다.

Q. UNIQUE 결과의 순서는 어떻게 정해지나요?

기본적으로 원본 범위에 처음 등장한 순서 그대로 나열된다. 정렬된 순서가 필요하면 SORT(UNIQUE(...))처럼 SORT로 한 번 더 감싸면 된다.

마무리

UNIQUE 함수를 "중복을 없애주는 신기한 기능"으로만 기억하기보다, "목록을 집합으로 재구성하는 함수"라고 이해해두면 다른 상황에서도 이 개념을 응용하기 쉬워진다. 다음 글에서는 이렇게 정리된 데이터를 원하는 기준으로 줄 세우는 SORT와 SORTBY가, 정렬 대상과 정렬 기준을 분리해서 생각한다는 것이 왜 유용한지 살펴본다.

이 블로그의 인기 게시물

[엑셀]엑셀 날짜는 사실 숫자다 — 1900년부터 세어온 일련번호의 정체

 날짜가 적힌 셀에 그냥 1을 더하면 무슨 일이 벌어질까? 신기하게도 결과는 정확히 '다음 날 날짜'가 된다. 문자처럼 보이는 날짜에 어떻게 숫자를 더했는데 날짜가 하루 늘어날 수 있을까. 답은 간단하다. 엑셀에서 날짜는 애초에 문자가 아니라 숫자이기 때문이다. 날짜가 숫자로 저장된다는 사실 확인하기 날짜가 입력된 셀의 서식을 '일반'으로 바꿔보면 그 정체가 바로 드러난다. 2026-01-15라고 표시되던 셀이 갑자기 46037 같은 숫자로 바뀐다. 이 숫자가 바로 엑셀이 내부적으로 이 날짜를 저장하고 있는 실제 값, 즉 시리얼 넘버(일련번호)다. 화면에 "2026-01-15"라고 보이는 것은 앞서 TEXT 함수 편에서 다룬 것처럼, 이 숫자 위에 날짜 서식이라는 표시 규칙이 덧씌워진 결과일 뿐이다. 1900년을 기준으로 세는 시리얼 넘버 시스템 엑셀은(윈도우 버전 기준) 1900년 1월 1일을 시리얼 넘버 1로 정하고, 그날부터 하루가 지날 때마다 숫자를 1씩 늘려가는 방식으로 날짜를 표현한다. 46037이라는 숫자는 곧 "1900년 1월 1일로부터 46,037번째 되는 날"이라는 뜻이다. 날짜에 숫자를 더하거나 빼는 계산이 자연스럽게 되는 이유가 바로 여기에 있다. 날짜끼리의 덧셈·뺄셈은 사실 이 일련번호끼리의 평범한 산술 연산일 뿐이다. =DATE(2026,1,15) + 30 이 수식은 2026년 1월 15일의 시리얼 넘버에 30을 더한 것과 같으므로, 결과는 정확히 30일 뒤의 날짜인 2026년 2월 14일이 된다. 시간은 어떻게 표현될까 — 소수점 이하가 하루의 몇 분의 몇인지 날짜가 정수로 표현된다면, 시간은 그 정수의 소수점 이하 부분으로 표현된다. 하루 24시간을 1로 놓았을 때, 낮 12시는 하루의 정확히 절반이므로 0.5가 된다. 예를 들어 46037.5라는 값은 "2026년 1월 15일 낮 12시"를 의미한다. 날짜와 시간이 함께 입력된 셀을 다룰 때 정수 부...

[엑셀]배열수식이란 무엇인가 — 하나의 셀에 여러 계산이 담기는 원리 스칼라 연산과 배열 연산의 차이

 셀 하나를 클릭했는데 그 안에서 수백 번의 계산이 동시에 일어나고 있다면 믿어지는가. 앞선 글에서 다룬 SUMPRODUCT나 SUMIF의 조건 판정이 바로 그런 경우였다. 겉으로는 셀 하나에 결과값 하나만 보이지만, 그 이면에서는 범위 전체를 대상으로 한 계산이 통째로 진행되고 있었다. 이 글에서는 이 현상의 정체, 즉 배열수식이라는 개념을 원리 차원에서 짚어본다. 스칼라 연산과 배열 연산의 차이 평소 우리가 쓰는 대부분의 수식은 '스칼라 연산'이다. =A2+B2 처럼 셀 하나와 셀 하나를 계산해서 값 하나를 내놓는 방식이다. 입력도 하나, 출력도 하나다. 반면 '배열 연산'은 여러 개의 값을 하나의 묶음(배열)으로 취급해서 한꺼번에 계산한다. =A2:A10+B2:B10 이라고 쓰면, 이는 A2+B2, A3+B3, ... A10+B10이라는 아홉 번의 계산을 동시에 수행하라는 뜻이 된다. 입력은 여러 개(범위 대 범위)지만, 이 계산 결과를 최종적으로 어떻게 압축해서 보여줄지는 그 다음 문제다. 결과가 여러 개인데 셀은 하나뿐이라면? 여기서 배열수식의 진짜 개념이 드러난다. 아홉 번의 계산 결과 아홉 개의 값이 나왔는데, 이를 담을 셀이 하나뿐이라면 엑셀은 어떻게 해야 할까. 과거 방식에서는 이 아홉 개의 값을 SUM이나 COUNT 같은 함수로 다시 하나로 압축해서 보여주는 방식을 썼다. 예를 들어 {=SUM(A2:A10*B2:B10)} 이라는 수식은 A와 B 각 행을 곱한 아홉 개의 결과를 배열로 만든 뒤, 그 아홉 개를 SUM으로 다시 하나로 합쳐 셀 하나에 담아내는 구조다. 여기서 중괄호 {} 는 사용자가 직접 입력하는 기호가 아니라, 예전 엑셀에서 Ctrl+Shift+Enter를 눌러 "이건 배열수식입니다"라고 선언했을 때 엑셀이 자동으로 붙여주던 표시였다. 왜 예전에는 이런 특별한 입력이 필요했나 일반 함수는 셀 하나 대 셀 하나로 계산하도록 설계되어 있었기 때문에, 여러 값을 배열째로 넘기려면 엑셀에게...

[엑셀]COUNTIF/COUNTIFS — 카운팅과 조건 매칭의 관계 SUMIF와의 구조적 유사성과 차이

 출석부를 관리하다 보면 "결석이 3회 이상인 학생 수"나 "이번 달 지각 횟수"처럼 특정 조건을 만족하는 항목이 '몇 개'인지 세야 하는 순간이 자주 온다. 앞선 글에서 다룬 SUMIF가 조건에 맞는 값들을 '더하는' 함수였다면, 이번에 다룰 COUNTIF는 조건에 맞는 항목이 '몇 개'인지를 세는 함수다. 이름도 구조도 SUMIF와 매우 닮았지만, 자세히 들여다보면 미묘하지만 중요한 차이가 하나 숨어 있다. COUNTIF의 기본 구조 =COUNTIF(A2:A100, "결석") COUNTIF는 조건을 검사할 범위와 조건, 이렇게 두 개의 인수만 받는다. A2:A100 범위에서 "결석"이라는 값과 일치하는 셀이 몇 개인지를 세어 그 개수를 반환한다. SUMIF와 COUNTIF의 구조적 유사성 지난 글에서 SUMIF의 원리를 "조건 범위를 참/거짓 배열로 바꾸고, 그 배열을 합계 범위 위에 겹쳐서 참인 위치만 더한다"고 설명했다. COUNTIF도 앞부분까지는 완전히 동일하다. 조건 범위를 검사해서 참/거짓 배열을 만드는 과정까지는 똑같다. 차이는 그다음이다. SUMIF는 이 배열을 다른 범위(합계 범위) 에 겹쳐서 값을 더하지만, COUNTIF는 겹칠 다른 범위 자체가 필요 없다. 그냥 참/거짓 배열에서 TRUE의 개수만 세면 끝나기 때문이다. 즉 "무엇을 더할지"를 지정할 필요가 없으므로 인수가 하나 줄어드는 것이다. 이렇게 보면 COUNTIF(범위, 조건)는 개념적으로 SUMIF(범위, 조건, 참거짓배열자체) 와 비슷한 일을 하는 셈이다. COUNTIFS — 여러 조건의 동시 만족 =COUNTIFS(A2:A100, "결석", B2:B100, ">=3") COUNTIFS 역시 SUMIFS와 동일한 방식으로 확장된다. 각 조건 범위마다 참/거짓 배열을 만들고, 이 배열들을...