모켓은 도구를 소개하는 정보 사이트이며 판매자·운영사가 아닙니다. 결제·환불·구독은 각 도구의 공식 채널(또는 App Store·Google Play)에서 진행됩니다.
소개
maskingtape는 한국어 문서와 데이터셋에서 주민등록번호·전화번호·주소·이름 등 개인정보를 탐지해 마스킹하거나 가명처리하는 Apache-2.0 오픈소스 엔진이다. Python 라이브러리, CLI, MCP 서버로 제공되어 AI 에이전트가 한국어 데이터를 다루기 전의 프라이버시 계층으로 쓸 수 있다. 정규식·사전 규칙을 기본으로 하고, 인명과 상호명 구분 같은 애매한 판단에만 선택적으로 로컬 LLM을 더하는 하이브리드 방식이며 외부 API는 호출하지 않는다.
장점
- •주민등록번호 체크섬 등 한국 포맷에 특화되어 영어권 도구가 놓치는 국내 식별자를 다룬다.
- •외부 API 호출 없이 로컬에서 동작해 개인정보가 밖으로 나가지 않는다.
- •LLM 없이 규칙 전용 모드로도 실행되어 저사양 환경에서 쓸 수 있다.
- •합성 데이터셋과 평가 스크립트가 공개되어 정확도를 직접 재현할 수 있다.
- •mask·label·pseudonym 세 가지 마스킹 방식을 용도에 맞게 고를 수 있다.
단점
- •규칙 전용 모드에서는 이름 재현율이 낮아 문맥 단서가 없는 이름을 놓칠 수 있다.
- •텍스트만 지원하며 docx와 이미지는 처리하지 못한다.
- •사번·학번·차량번호·IP 등 11종 밖의 식별자와 영문·중문·일문 이름·주소는 탐지하지 못한다.
- •구분자 없는 사업자등록번호 등 일부 표기는 알려진 미탐 사례로 남아 있다.
핵심 기능
규칙 기반 + 로컬 LLM 하이브리드 탐지
정규식·사전 규칙으로 빠르게 탐지하고, 애매한 이름 판별에는 선택적으로 로컬 LLM의 문맥 판단을 더한다.
한국어 개인정보 11종 탐지
주민등록번호, 전화번호, 이메일, 주소, 신용카드, 계좌번호, 사업자등록번호, 여권번호, 생년월일, 운전면허번호, 이름을 탐지한다.
세 가지 마스킹 방식
완전 가림(mask), 종류 라벨 치환(label), 그럴듯한 가짜 값으로 바꾸는 가명처리(pseudonym)를 지원한다.
라이브러리·CLI·MCP 서버
Python 라이브러리, 명령줄 도구, AI 에이전트 워크플로에 끼우는 MCP 서버 형태로 제공된다.
완전 로컬 처리
외부 API 호출 없이 동작하며 LLM도 Ollama 기반 오픈웨이트 모델만 사용해 개인정보가 밖으로 나가지 않는다.
규칙 전용 모드
LLM 없이도 동작해 저사양 환경에서 쓸 수 있다.
공개 벤치마크 재현
자체 합성 데이터셋과 평가 스크립트를 공개해 누구나 정확도를 재현할 수 있다.
공식 사이트 2026-10-01 콘텐츠 검증
이 도구의 주요 활용
- ·LLM에 넣기 전 한국어 문서의 개인정보 제거
- ·한국어 데이터셋을 공유하기 전 가명처리
- ·AI 에이전트 워크플로에 MCP 서버로 비식별화 단계 삽입
- ·CLI로 텍스트의 개인정보 탐지 리포트(JSON) 생성
- ·고객 문의·상담 로그의 주민번호·연락처 마스킹
자주 묻는 질문
어떤 개인정보를 탐지하나요?
주민등록번호, 전화번호, 이메일, 주소, 신용카드, 계좌번호, 사업자등록번호, 여권번호, 생년월일, 운전면허번호, 이름 등 11종을 탐지합니다. 사번·학번·차량번호·IP 같은 그 밖의 식별자는 지원하지 않습니다.
로컬 LLM 없이도 쓸 수 있나요?
가능합니다. 규칙 전용 모드로 동작하며 코어 엔진과 CLI는 표준 라이브러리만 사용합니다. 로컬 LLM은 이름 탐지 등 문맥 판단을 보강하는 선택 기능입니다.
개인정보가 외부로 전송되나요?
외부 API를 호출하지 않으며 LLM도 Ollama 기반 오픈웨이트 모델만 사용하도록 설계되어 있어 데이터가 밖으로 나가지 않는다고 밝히고 있습니다.
마스킹 방식은 어떻게 선택하나요?
값을 완전히 지우려면 mask, 무엇이 있었는지 남기려면 label, 문장 구조를 살린 채 데이터셋을 공유하거나 LLM 전처리에 넘기려면 pseudonym을 씁니다.
어떤 입력 형식을 지원하나요?
텍스트(str)를 지원합니다. docx와 이미지는 지원하지 않고, PDF는 웹 데모에서 텍스트 추출만 됩니다.
탐지 정확도는 믿을 만한가요?
합성 데이터셋 기준으로 규칙 전용 모드의 이름 재현율은 낮은 편이라 일부를 놓칠 수 있습니다. 놓치는 표기를 README에 공개하므로 중요한 용도에서는 결과를 따로 검증하는 것이 좋습니다.
AI 에이전트와 연동할 수 있나요?
MCP 서버를 제공해 AI 에이전트가 한국어 데이터를 다루기 전에 거치는 비식별화 계층으로 끼워 넣을 수 있습니다.
사용자 리뷰
불러오는 중...

