문자 encoding 진단
텍스트·유니코드 · 파일·OS
진단과 변환은 이 browser 안에서만 실행됩니다. 선택한 파일은 업로드하지 않고 원본도 덮어쓰지 않습니다.
16 MiB까지의 파일을 drop하거나 선택합니다. 읽어 들이면 곧바로 후보가 나옵니다.
표의 preview를 보고 의도한 문장으로 읽히는 후보를 고릅니다. 자동으로 확정하지 않습니다.
결과
파일을 읽어 들이면 여기에 결과가 나옵니다.
사용 방법
파일 읽어 들이기
text 파일을 drop합니다. BOM·16진 dump와 7가지 문자 encoding으로 읽은 결과가 함께 나옵니다.
preview 비교하기
치환 문자와 제어 문자 개수를 단서로, 의도한 문장으로 자연스럽게 읽히는 후보를 찾습니다.
UTF-8로 저장하기
원래 문자 encoding을 고르고 필요하면 BOM을 붙여 저장합니다. 손실이 생기는 변환은 기본적으로 멈춥니다.
판정 범위
입력은 16 MiB까지, preview는 처음 2,000자, 16진 dump는 처음 256 byte입니다. 출력은 UTF-8뿐이고 BOM 유무만 고를 수 있습니다. UTF-32는 BOM 검출만 하고 변환은 거부합니다. 문자 encoding 자동 확정, 이미 치환된 문자 복원, 줄바꿈·Unicode 정규화의 자동 변경은 하지 않습니다. Shift_JIS 등의 지원 여부와 호환 mapping은 browser의 TextDecoder 구현을 따릅니다.
자주 묻는 질문
- 문자 encoding을 자동으로 확정해 주나요?
- 확정하지 않습니다. 같은 byte 열이 여러 문자 encoding에서 유효할 수 있습니다. BOM과 preview를 비교해 고르세요.
- “치환 없이 읽힘”이면 올바른 문자 encoding인가요?
- 아닙니다. byte 열로 유효해도 의도한 문장이라는 뜻은 아닙니다. 단어와 문장 부호가 자연스러운지도 확인하세요.
- 깨진 문장을 되돌릴 수 있나요?
- 원래 byte 열이 남아 있고 올바른 문자 encoding을 고를 수 있으면 다시 읽힙니다. 이미 치환 문자가 된 정보는 복원할 수 없습니다.
- UTF-8 말고 다른 형식으로 저장할 수 있나요?
- 출력은 UTF-8뿐입니다. UTF-8 BOM을 붙일지만 고를 수 있습니다.