빅데이터분석기사 시험 노트개념 정리21 MIN
비식별 조치와 프라이버시 보호 모델
개인정보와 가명정보와 익명정보를 먼저 가르고, 비식별 조치 네 단계와 기법 다섯 갈래를 본 뒤 k-익명성·l-다양성·t-근접성이 각각 어떤 공격을 막으려고 붙었는지와 사후관리·파기까지 정리합니다.
앞 노트가 「이 정보를 써도 되는가」를 법으로 갈랐다면 이 노트는 그 선을 넘기 위해 데이터를 어떻게 손보는가를 다룹니다. 가명정보 특례가 열어 준 길이 있어도 원본을 그대로 쓸 수는 없으니 식별할 수 있는 부분을 지우거나 뭉개야 하고, 얼마나 뭉개야 충분한지를 사람 감으로 정할 수 없으니 숫자로 재는 기준이 필요합니다. 그 두 가지가 이 노트의 내용이고, 문항은 대개 「이 표는 k-익명성을 만족하는가」처럼 데이터를 주고 판정을 시킵니다.
세 가지 상태
개인정보·가명정보·익명정보
같은 데이터가 처리 정도에 따라 셋 중 하나의 상태에 놓입니다.
| 상태 | 무엇인가 | 원래대로 되돌릴 수 있나 |
|---|---|---|
| 개인정보 | 그대로 개인을 알아볼 수 있다 | 되돌릴 것이 없다 |
| 가명정보 | 추가 정보 없이는 개인을 못 알아본다 | 추가 정보가 있으면 된다 |
| 익명정보 | 시간·비용·기술을 합리적으로 따져도 더는 못 알아본다 | 안 된다 |
가르는 축은 「추가 정보를 쓰면 되돌아가는가」 하나입니다. 이름을 난수로 바꾸고 그 대응표를 따로 금고에 넣어 두었다면 대응표가 추가 정보이므로 가명정보입니다. 대응표 자체를 만들지 않고 나이를 열 살 단위로 뭉개 버렸다면 되돌릴 근거가 없으므로 익명정보 쪽입니다.
법의 적용 범위
이 구분이 실무에서 갈리는 지점은 법이 어디까지 따라오느냐입니다.
- 가명정보는 여전히 개인정보입니다. 통계작성·과학적 연구·공익적 기록보존이라는 세 목적 안에서만 동의 없이 쓸 수 있고, 안전조치 의무와 결합 제한이 그대로 붙습니다.
- 익명정보는 개인정보가 아니므로 개인정보 보호법이 적용되지 않습니다. 목적 제한도 없습니다.
그래서 「익명처리했으니 마음대로 써도 된다」는 말은 정말로 익명정보가 되었을 때만 맞습니다. 이름만 지우고 생년월일·성별·우편번호를 남긴 표는 익명정보가 아닙니다. 그 셋만 있어도 상당수의 사람이 한 명으로 좁혀진다는 것이 비식별 논의가 시작된 계기였습니다.
비식별 조치 네 단계
사전검토와 비식별 조치
비식별 절차는 네 단계로 정리됩니다. 순서를 묻는 문항이 그대로 나오므로 각 단계가 무엇을 산출하는지까지 잡아 둡니다.
- 사전검토 — 그 데이터가 개인정보에 해당하는지부터 판단합니다. 개인정보가 아니면 비식별 조치 없이 활용할 수 있으므로 여기서 갈라집니다.
- 비식별 조치 — 식별자를 지우고 속성자를 뭉갭니다. 아래의 다섯 기법이 여기서 쓰입니다.
- 적정성 평가 — 조치가 충분했는지를 평가단이 판정합니다.
- 사후관리 — 재식별 위험을 계속 살피고 필요하면 파기합니다.
2단계에서 다루는 대상이 둘로 갈립니다. 식별자는 이름·주민등록번호·전화번호처럼 그 자체로 개인을 가리키는 항목이라 원칙적으로 삭제합니다. 속성자는 나이·성별·지역·직업처럼 그것만으로는 개인을 못 가리키지만 여럿이 모이면 좁혀지는 항목이라 삭제가 아니라 뭉개는 대상입니다.
적정성 평가
3단계는 조치한 사람이 스스로 통과시키지 못하게 막아 둔 자리입니다. 평가단을 꾸릴 때 외부 전문가를 과반수로 두게 한 것이 그 장치이고, 평가는 프라이버시 보호 모델의 값을 실제로 계산해 기준을 넘는지로 판정합니다. 기본으로 쓰는 것이 아래에서 볼 k-익명성이고, 데이터의 민감도에 따라 l-다양성이나 t-근접성을 더 겁니다.
부족하다고 판정되면 2단계로 돌아가 더 뭉갠 뒤 다시 평가받습니다. 「한 번 조치하고 끝」이 아니라 평가와 조치 사이를 오가는 고리라는 점이 이 절차의 성격입니다.
사후관리
통과했다고 안전이 고정되는 것은 아닙니다. 바깥에 새로운 데이터가 공개되면 예전에는 못 맞추던 것이 맞춰지기 때문입니다. 그래서 사후관리는 관리적 조치와 기술적 조치 둘로 짭니다.
| 갈래 | 하는 일 |
|---|---|
| 관리적 보호조치 | 담당자를 지정하고, 재식별 가능성을 주기적으로 점검하며, 제공 대상과 이용 목적을 관리한다 |
| 기술적 보호조치 | 접근 권한을 나누고 접근 기록을 남기며 저장 구간을 보호한다 |
점검에서 재식별 가능성이 확인되면 즉시 처리를 멈추고 추가 조치를 하거나 파기합니다.
비식별 기법
다섯 갈래
기법은 다섯으로 묶입니다. 세부 기법의 이름이 보기로 나오므로 어느 갈래에 속하는지까지 봐 둡니다.
| 기법 | 하는 일 | 세부 기법 |
|---|---|---|
| 가명처리 | 다른 값으로 바꿔 치운다 | 휴리스틱 가명화, 암호화, 교환 방법 |
| 총계처리 | 개별 값 대신 합계·평균을 보인다 | 총계처리, 부분총계, 라운딩, 재배열 |
| 데이터 삭제 | 항목이나 레코드를 지운다 | 식별자 삭제, 부분 삭제, 레코드 삭제 |
| 데이터 범주화 | 값을 구간이나 범주로 바꾼다 | 감추기, 랜덤 라운딩, 범위 방법, 세분 정보 제한 |
| 데이터 마스킹 | 일부를 가려 표시한다 | 임의 잡음 추가, 공백과 대체 |
헷갈리는 짝이 가명처리와 마스킹입니다. 가명처리는 「홍길동」을 「사용자 A」처럼 다른 값으로 대체하는 것이고, 마스킹은 「홍○○」처럼 자리는 남기고 일부를 가리는 것입니다. 총계처리와 범주화도 비슷하게 갈립니다 — 총계처리는 여러 행을 하나의 통계값으로 접고, 범주화는 행은 그대로 두고 값만 넓은 구간으로 바꿉니다.
유용성과 안전성
기법을 세게 걸수록 재식별은 어려워지고 분석 가치는 떨어집니다. 나이를 그대로 두면 정확한 연령 분석이 되지만 식별 위험이 크고, 10년 단위로 뭉개면 안전해지는 대신 세밀한 추세가 사라집니다. 비식별의 모든 판단은 이 유용성과 안전성의 맞바꿈 위에 있고, 적정성 평가가 그 지점을 정하는 절차입니다.
프라이버시 보호 모델
k-익명성
동질집합은 공개된 속성자의 값이 모두 같은 레코드들의 묶음입니다. 「40대·남성·서울 마포구」가 한 동질집합이 되는 식입니다.
k-익명성은 모든 동질집합의 크기가 k 이상이라는 조건입니다. 어떤 사람을 지목해도 같은 조건에 해당하는 사람이 최소 k명이므로 한 명으로 좁혀지지 않습니다. 계산은 동질집합별로 세어 가장 작은 값을 찾는 것이 전부입니다.
import pandas as pd
df = pd.DataFrame({
'연령대': ['40대', '40대', '40대', '30대', '30대'],
'성별': ['남', '남', '남', '여', '여'],
'지역': ['마포', '마포', '마포', '강남', '강남'],
'질병': ['위염', '위염', '위염', '독감', '골절'],
})
sizes = df.groupby(['연령대', '성별', '지역']).size()
print(sizes.min()) # k = 2
print(df.groupby(['연령대', '성별', '지역'])['질병'].nunique().min()) # l = 1
위 표는 동질집합이 둘이고 크기가 3과 2이므로 k는 2입니다. k를 3으로 올리려면 뒤쪽 두 행을 다른 집합과 합치도록 더 뭉개야 합니다.
l-다양성과 t-근접성
k-익명성만으로는 못 막는 구멍이 둘 있습니다.
- 동질성 공격 — 같은 동질집합에 든 사람들의 민감정보가 전부 같으면, 누가 누군지 몰라도 그 사람의 질병은 알 수 있습니다. 위 코드의 앞 집합이 정확히 그 경우로 세 명 모두 위염이라 k가 2여도 질병이 새어 나갑니다.
- 배경지식 공격 — 공격자가 미리 아는 사실을 보태 후보를 지워 나가면 한 명으로 좁혀집니다.
l-다양성은 여기에 붙는 조건으로, 각 동질집합 안의 민감정보가 서로 다른 값을 l개 이상 가져야 한다고 요구합니다. 위 예에서 앞 집합의 l은 1이라 l-다양성을 만족하지 못합니다.
l-다양성에도 남는 구멍이 있습니다. 값이 두 가지여도 한쪽으로 심하게 쏠려 있으면(쏠림 공격) 또는 서로 다른 값이지만 의미가 비슷하면(유사성 공격) 사실상 알려지는 것과 같습니다. 「위암」과 「간암」은 다른 값이지만 둘 다 암입니다. t-근접성은 동질집합 안 민감정보의 분포가 전체 분포와 t 이하로 차이 나야 한다고 요구해 이 자리를 막습니다.
셋은 대체하는 관계가 아니라 쌓아 올리는 관계입니다. 앞의 것이 남긴 구멍을 뒤의 것이 막고, 조건이 강해질수록 데이터는 더 뭉개집니다.
재식별과 파기
재식별 위험
재식별은 비식별 처리된 데이터에서 다시 개인을 알아보는 것입니다. 위험이 커지는 경로가 셋입니다.
- 다른 데이터와의 결합 — 공개된 다른 자료와 속성자를 맞추면 좁혀집니다. 비식별 논의의 출발점이자 결합을 전문기관에 맡기게 한 이유입니다.
- 시간의 경과 — 계산 능력이 오르고 공개 데이터가 늘면서, 처리 당시에는 충분했던 조치가 나중에 부족해집니다.
- 희귀값 — 아주 드문 직업이나 극단적인 값은 뭉개도 한 명으로 남기 쉽습니다.
그래서 적정성 평가의 판정은 영구적이지 않고 사후관리가 따라붙습니다.
파기
보유 기간이 지났거나 처리 목적을 이룬 개인정보는 지체 없이 파기합니다. 파기는 복원할 수 없는 방법이어야 하므로 전자 파일은 영구 삭제하고 출력물은 파쇄하거나 소각합니다. 다른 법령에 보존 의무가 있으면 그 기간 동안은 다른 개인정보와 분리해 보관합니다.
재식별 가능성이 확인된 데이터도 같은 절차로 처리합니다 — 즉시 이용을 멈추고, 추가 조치로 낮출 수 없으면 파기합니다.
연습 문제
가명정보와 익명정보를 가르는 기준으로 옳은 것은?
① 처리에 쓴 기법이 삭제인지 범주화인지
② 추가 정보를 쓰면 원래 개인을 알아볼 수 있는지
③ 데이터의 건수가 5만 건을 넘는지
④ 처리한 주체가 공공기관인지 민간인지②. 되돌릴 수 있으면 가명정보, 합리적으로 따져 되돌릴 수 없으면 익명정보입니다. 가명정보는 개인정보라 법이 그대로 적용되고 익명정보는 적용되지 않습니다.비식별 조치의 네 단계를 순서대로 나열한 것은?
① 사전검토 → 비식별 조치 → 적정성 평가 → 사후관리
② 비식별 조치 → 사전검토 → 사후관리 → 적정성 평가
③ 적정성 평가 → 사전검토 → 비식별 조치 → 사후관리
④ 사전검토 → 적정성 평가 → 비식별 조치 → 사후관리①. 먼저 개인정보인지 판단하고, 조치한 뒤, 충분한지 평가받고, 통과 후에도 계속 관리합니다. 평가가 조치보다 앞설 수 없습니다.「홍길동」을 「홍○○」으로 바꾼 것은 어느 기법에 해당합니까?
① 총계처리
② 데이터 범주화
③ 데이터 마스킹
④ 가명처리③. 자리는 남기고 일부를 가렸으므로 마스킹입니다. 가명처리라면 「사용자 A」처럼 다른 값으로 대체합니다.다음 표에서 공개 속성자가 연령대·성별이고 민감정보가 질병일 때 k와 l의 값은?
(30대·여·독감) (30대·여·독감) (30대·여·위염) (50대·남·골절) (50대·남·고혈압)
① k = 2, l = 1
② k = 2, l = 2
③ k = 3, l = 1
④ k = 3, l = 2②. 동질집합은 (30대·여) 셋과 (50대·남) 둘이라 작은 쪽이 2이므로 k는 2입니다. 질병의 서로 다른 값은 앞 집합이 독감·위염 둘, 뒤 집합이 골절·고혈압 둘이라 작은 쪽이 2이므로 l도 2입니다.어느 동질집합에 5명이 들어 있고 이들의 질병이 모두 「위염」입니다. 이 상황이 보여 주는 것은?
① k-익명성을 만족하지 못한다
② k-익명성은 만족하지만 동질성 공격에 뚫린다
③ t-근접성은 만족하지만 k-익명성에 뚫린다
④ 재식별 위험이 전혀 없다②. 집합 크기가 5라 k-익명성 쪽은 문제가 없지만, 민감정보가 한 값뿐이라 누구인지 몰라도 질병은 알려집니다. l-다양성이 이 구멍을 막으려고 붙은 조건입니다.l-다양성을 만족해도 남는 위험을 막기 위한 모델과 그 이유로 옳은 것은?
① k-익명성 — 동질집합의 크기가 작을 수 있어서
② t-근접성 — 값이 한쪽으로 쏠리거나 의미가 비슷할 수 있어서
③ 데이터 마스킹 — 식별자가 남아 있을 수 있어서
④ 총계처리 — 레코드 수가 많을 수 있어서②. 값이 둘이어도 한쪽에 몰려 있거나 「위암」과 「간암」처럼 의미가 가까우면 사실상 알려집니다. t-근접성은 동질집합의 분포를 전체 분포와 견주어 이 자리를 막습니다.개인정보의 파기에 대한 설명으로 옳지 않은 것은?
① 보유 기간이 지나면 지체 없이 파기한다
② 복원할 수 없는 방법으로 파기해야 한다
③ 다른 법령에 보존 의무가 있으면 다른 개인정보와 분리해 보관한다
④ 적정성 평가를 통과한 데이터는 재식별 위험이 확인되어도 파기 대상이 아니다④. 적정성 평가의 판정은 그 시점의 것이라 영구적이지 않습니다. 사후관리에서 재식별 가능성이 확인되면 즉시 이용을 멈추고 추가 조치를 하거나 파기합니다.
이 단원의 문항은 거의 전부 뭉갠 정도를 세어 보는 일로 환원됩니다. 표가 주어지면 먼저 속성자로 동질집합을 묶고, 가장 작은 집합의 크기가 k이며, 그 집합 안 민감정보의 서로 다른 값 개수가 l입니다. 그 둘을 세고도 답이 갈리지 않으면 값의 분포를 보는 t-근접성 차례입니다. 세는 순서가 곧 모델이 쌓인 순서라, 순서를 외우면 계산 문항과 개념 문항이 함께 풀립니다.

