Microsoft MVP성태의 닷넷 이야기
.NET Framework: 368. Encoding 타입의 대체(fallback) 메카니즘 [링크 복사], [링크+제목 복사],
조회: 20034
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
 
(연관된 글이 2개 있습니다.)
(시리즈 글이 7개 있습니다.)
.NET Framework: 248. 닷넷에서 지원되는 문자열 인코딩 이름 목록
; https://www.sysnet.pe.kr/2/0/1147

.NET Framework: 368. Encoding 타입의 대체(fallback) 메카니즘
; https://www.sysnet.pe.kr/2/0/1446

.NET Framework: 373. C# 문자열의 인코딩이란?
; https://www.sysnet.pe.kr/2/0/1461

.NET Framework: 701. 한글이 포함된 바이트 배열을 나눈 경우 한글이 깨지지 않도록 다시 조합하는 방법
; https://www.sysnet.pe.kr/2/0/11378

.NET Framework: 702. 한글이 포함된 바이트 배열을 나눈 경우 한글이 깨지지 않도록 다시 조합하는 방법(두 번째 이야기)
; https://www.sysnet.pe.kr/2/0/11381

.NET Framework: 867. C# - Encoding.Default 값을 바꿀 수 있을까요?
; https://www.sysnet.pe.kr/2/0/12037

닷넷: 2190. C# - 닷넷 코어/5+에서 달라지는 System.Text.Encoding 지원
; https://www.sysnet.pe.kr/2/0/13506




Encoding 타입의 대체(fallback) 메카니즘

이번 글은 다음의 질문에 대한 답변입니다.

ksc5601에서 지원하지않는 확장문자 찾는방법
; https://www.sysnet.pe.kr/3/0/1136

사실, "찾는 방법"까지는 설명할 수 없고 이런 기능을 하도록 BCL의 기능을 하나 이용해 볼 텐데요.

일단, 문제를 간략화 시켜 정리해 보면 다음과 같습니다.

  • 유니코드 데이터를 읽어서 ks_c_5601-1987로 변환.
  • 이 과정에서 ks_c_5601-1987에서 표현할 수 없는 유니코드 문자는 원하는 문자로 대체

그런데, Java를 언급하는 것으로 보아 실제로 사용된 인코딩 방식은 윈도우 기준으로 보면 "ks_c_5601-1987"이 아니라 "euc-kr"이 아닌가 싶습니다. 전에도 아래의 글을 통해 한번 언급했지만,

유니코드와 한글 - 유니코드와 닷넷을 이용한 한글 처리
; https://www.sysnet.pe.kr/2/0/1294

"샾"이라는 문자는 euc-kr 인코딩에서 표현이 안되는 것이지, ks_c_5601-1987에는 해당 단어가 표현가능합니다. (자바에서는 euc-kr이 ks_c_5601-1987로 사용되는 것으로 알고 있습니다.)

이를 감안해서, 이후로는 euc-kr로 두고 설명을 하겠습니다.




자, 그럼 코드로 표현해 볼까요? ^^

static void Main(string[] args)
{
    // 샾: 0xC0FE
    // 유니코드 C000~CFFF
    // ; http://ko.wikipedia.org/wiki/%EC%9C%A0%EB%8B%88%EC%BD%94%EB%93%9C_C000~CFFF

    // Little-endian 유니 코드
    // 클라이언트로부터 입력된 데이터가 unicodeBuffer에 있다고 가정.
    byte[] unicodeBuffer = Encoding.Unicode.GetBytes("샾");

    // 전달받은 유니코드 인코딩된 데이터를 다시 디코딩
    string orgText = Encoding.Unicode.GetString(unicodeBuffer);

    // 복원된 데이터를 다시 euc-kr로 인코딩
    Encoding eucEncode = Encoding.GetEncoding("euc-kr");

    byte [] eucBuffer = eucEncode.GetBytes(orgText);
    string target = eucEncode.GetString(eucBuffer);

    Console.WriteLine(target);
}

위의 코드를 실행했을 때 화면에는 "?" 글자만 찍힙니다. 유니코드로는 표현 가능한 "샾" 글자가 euc-kr 인코딩에는 없기 때문입니다.

닷넷 BCL의 Encoding 타입은 변환되지 않는 글자에 대해 기본적으로 '?'로 치환합니다. 물론, '?' 기본문자를 바꾸는 것도 가능한데 이를 위해 GetEncoding 메소드에 다음의 2가지 인자를 넣어주어야 합니다.

Encoding eucEncode = Encoding.GetEncoding("euc-kr",
    new EncoderReplacementFallback("*"), new DecoderReplacementFallback("*"));

이렇게 변경하고 다시 실행해 보면, "샾" 글자가 "*"로 치환된 것을 확인할 수 있습니다.

제가 Java는 잘 몰라서 ^^ 유사한 코드를 알진 못하지만 아마도 닷넷의 EncoderReplacementFallback 같은 방식이 자바에서도 제공될 것이므로 그것을 찾아보면 됩니다.




만약, 자바에서 제공되지 않는다면 직접 euc-kr과 unicode 간의 매핑을 해줘야 합니다. 제가 알기로는 이에 대한 공식화된 규칙은 없으며 다른 사람들이 만들어 놓은 소스 코드를 참조하시는 것이 그나마 빠르게 시작할 수 있는 방법입니다.

EUC-KR to UNICODE mapping 
; http://ricardohu.wikispaces.com/EUC-KR+to+UNICODE+mapping

위의 코드 표에서 euc-kr에는 없는 unicode 값이 들어온다면 그 글자를 원하는 것으로 치환하도록 직접 코드를 만들어 주어야 합니다.




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 11/2/2022]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 



2020-02-04 10시51분
C# - Encoding.Default 값을 바꿀 수 있을까요?
; https://www.sysnet.pe.kr/2/0/12037

Encoding defaultEncoding = Encoding.GetEncoding(Encoding.ASCII.CodePage,
    new EncoderReplacementFallback(""), new DecoderReplacementFallback(""));

SetDefaultEncoding(defaultEncoding);
정성태

... 61  62  63  64  65  66  67  68  69  70  [71]  72  73  74  75  ...
NoWriterDateCnt.TitleFile(s)
11865정성태4/9/201911352오류 유형: 529. 제어판 - C:\ProgramData\Microsoft\Windows\Start Menu\Programs\Administrative Tools is not accessible.
11864정성태4/9/201910558오류 유형: 528. '...' could be '0': this does not adhere to the specification for the function '...'
11863정성태4/9/201910367디버깅 기술: 127. windbg - .NET x64 EXE의 EntryPoint
11862정성태4/7/201912441개발 환경 구성: 437. .NET EXE의 ASLR 기능을 끄는 방법
11861정성태4/6/201912193디버깅 기술: 126. windbg - .NET x86 CLR2/CLR4 EXE의 EntryPoint
11860정성태4/5/201915484오류 유형: 527. Visual C++ 컴파일 오류 - error C2220: warning treated as error - no 'object' file generated
11859정성태4/4/201912851디버깅 기술: 125. WinDbg로 EXE의 EntryPoint에서 BP 거는 방법
11858정성태3/27/201913290VC++: 129. EXE를 LoadLibrary로 로딩해 PE 헤더에 있는 EntryPoint를 직접 호출하는 방법파일 다운로드1
11857정성태3/26/201912196VC++: 128. strncpy 사용 시 주의 사항(Linux / Windows)
11856정성태3/25/201912178VS.NET IDE: 134. 마이크로소프트의 CoreCLR 프로파일러 리눅스 예제를 Visual Studio F5 원격 디버깅하는 방법 [1]파일 다운로드1
11855정성태3/25/201914187개발 환경 구성: 436. 페이스북 HTTPS 인증을 localhost에서 테스트하는 방법
11854정성태3/25/201910140VS.NET IDE: 133. IIS Express로 호스팅하는 사이트를 https로 접근하는 방법
11853정성태3/24/201912299개발 환경 구성: 435. 존재하지 않는 IP 주소에 대한 Dns.GetHostByAddress/gethostbyaddr/GetNameInfoW 실행이 느리다면? - 두 번째 이야기 [1]
11852정성태3/20/201912554개발 환경 구성: 434. 존재하지 않는 IP 주소에 대한 Dns.GetHostByAddress/gethostbyaddr/GetNameInfoW 실행이 느리다면?파일 다운로드1
11851정성태3/19/201915434Linux: 8. C# - 리눅스 환경에서 DllImport 대신 라이브러리 동적 로드 처리 [2]
11850정성태3/18/201914007.NET Framework: 813. C# async 메서드에서 out/ref/in 유형의 인자를 사용하지 못하는 이유
11849정성태3/18/201913806.NET Framework: 812. pscp.exe 기능을 C#으로 제어하는 방법파일 다운로드1
11848정성태3/17/201911222스크립트: 14. 윈도우 CMD - 파일이 변경된 경우 파일명을 변경해 복사하고 싶다면?
11847정성태3/17/201915101Linux: 7. 리눅스 C/C++ - 공유 라이브러리 동적 로딩 후 export 함수 사용 방법파일 다운로드1
11846정성태3/15/201913503Linux: 6. getenv, setenv가 언어/운영체제마다 호환이 안 되는 문제
11845정성태3/15/201914227Linux: 5. Linux 응용 프로그램의 (C++) so 의존성 줄이기(ReleaseMinDependency) [3]
11844정성태3/14/201915020개발 환경 구성: 434. Visual Studio 2019 - 리눅스 프로젝트를 이용한 공유/실행(so/out) 프로그램 개발 환경 설정 [1]파일 다운로드1
11843정성태3/14/201910807기타: 75. MSDN 웹 사이트를 기본으로 영문 페이지로 열고 싶다면?
11842정성태3/13/201910226개발 환경 구성: 433. 마이크로소프트의 CoreCLR 프로파일러 예제를 Visual Studio CMake로 빌드하는 방법 [1]파일 다운로드1
11841정성태3/13/201910195VS.NET IDE: 132. Visual Studio 2019 - CMake의 컴파일러를 기본 g++에서 clang++로 변경
11840정성태3/13/201911281오류 유형: 526. 윈도우 10 Ubuntu App 환경에서는 USB 외장 하드 접근 불가
... 61  62  63  64  65  66  67  68  69  70  [71]  72  73  74  75  ...