Microsoft MVP성태의 닷넷 이야기
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
 
(연관된 글이 1개 있습니다.)
(시리즈 글이 12개 있습니다.)
.NET Framework: 326. 유니코드와 한글 - 유니코드와 닷넷을 이용한 한글 처리
; https://www.sysnet.pe.kr/2/0/1294

.NET Framework: 411. 유니코드의 "compatibility character"가 뭘까요?
; https://www.sysnet.pe.kr/2/0/1607

.NET Framework: 429. C# - 유니코드 한글 문자열을 ks_c_5601-1987로 변환하는 방법
; https://www.sysnet.pe.kr/2/0/1657

개발 환경 구성: 230. 유니코드의 Surrogate Pair, Supplementary Characters가 뭘까요?
; https://www.sysnet.pe.kr/2/0/1710

.NET Framework: 450. 영문 윈도우에서 C# 콘솔 프로그램의 유니코드 출력 방법
; https://www.sysnet.pe.kr/2/0/1712

.NET Framework: 794. C# - 같은 모양, 다른 값의 한글 자음을 비교하는 호환 분해
; https://www.sysnet.pe.kr/2/0/11710

개발 환경 구성: 407. 유니코드와 한글 - "Hangul Compatibility Jamo"
; https://www.sysnet.pe.kr/2/0/11724

Windows: 176. Raymond Chen이 한글날에 밝히는 윈도우의 한글 자모 분리 현상
; https://www.sysnet.pe.kr/2/0/12369

닷넷: 2307. C# - 윈도우에서 한글(및 유니코드)을 포함한 콘솔 프로그램을 컴파일 및 실행하는 방법
; https://www.sysnet.pe.kr/2/0/13794

개발 환경 구성: 731. 유니코드 - 출력 예시 및 폰트 찾기
; https://www.sysnet.pe.kr/2/0/13798

개발 환경 구성: 732. 모바일 웹 브라우저에서 유니코드 문자가 표시되지 않는 경우
; https://www.sysnet.pe.kr/2/0/13799

닷넷: 2310. .NET의 Rune 타입과 emoji 표현
; https://www.sysnet.pe.kr/2/0/13813




C# - 같은 모양, 다른 값의 한글 자음을 비교하는 호환 분해

다음과 같은 질문이 있군요. ^^

문자 질문입니다.
; https://www.sysnet.pe.kr/3/0/5065

위 질문에 링크된 글이 재미있습니다.

같은 모양, 다른 값의 한글 자음
; http://winplz.tistory.com/entry/%ED%95%9C%EA%B8%80-%EC%9E%90%EC%9D%8C-%EB%B9%84%EA%B5%90%EA%B0%99%EC%A7%80%EB%A7%8C-%EB%8B%A4%EB%A5%B8-%EC%9E%90%EC%9D%8C%EB%93%A4

위의 글은 iOS의 Objective C나 Swift 환경으로 설명하는 것 같은데, 닷넷 환경으로 질문을 다시 옮겨 보면 이렇습니다.

{
    string txt1 = "ㄱ";
    string txt2 = "각";

    String nfd = txt1.Normalize(System.Text.NormalizationForm.FormD);
    String nfc = txt2.Normalize(System.Text.NormalizationForm.FormD);

    Console.WriteLine(nfd + ": " + (int)nfd[0]);
    Console.WriteLine(nfc[0] + ": " + (int)nfc[0]);
}

/*
출력 결과:

ㄱ: 12593
ㄱ: 4352
*/

출력 결과가 상이한데, 처음의 'ㄱ'은 한글 자음을 나타내는 문자(유니코드 심벌 명은 "Hangul Letter Kiyeok")이고 두 번째 줄의 경우는 약간 '위 첨자' 식으로 상단에 살짝 떠 있는 초성에서의 'ㄱ'(유니코드 심벌 명은 "Hangul Choseong Kiyeok")을 나타냅니다. 따라서, 어찌 보면 당연히 달라야 하지만 '자음 입력에 따른 검색 엔진'을 구현하는 경우에는 이 결과가 그다지 바람직하지 않습니다.

재미있는 것은, 2개의 문자가 속한 "Unicode Group"입니다.

[그림: "Hangul Jamo"에 속한 "Hangul Letter Kiyeok"]
hangul_unicode_jamo_0.png

[그림: "Hangul Compatibility Jamo"에 속한 "Hangul Choseong Kiyeok"]
hangul_unicode_jamo_1.png

"Hangul Compatibility Jamo"의 wikipedia 설명을 보면,

Hangul Compatibility Jamo
; https://en.wikipedia.org/wiki/Hangul_Compatibility_Jamo

Hangul Compatibility Jamo is a Unicode block containing Hangul characters for compatibility with Korean Standard KS X 1001:1998.

"Hangul Compatibility Jamo" 영역의 문자들은 KS X 1001:1998 표준과 호환하는 글자를 포함한다고 합니다.

KS X 1001
; https://en.wikipedia.org/wiki/KS_X_1001

위의 문서를 보면, KS X 1001은 "KSC-5601"로 불렸던 한글 문자 셋의 새 이름인데, KSC-5601 문자 셋과의 호환을 위해 특별히 유니코드에서 별도로 "Hangul Compatibility Jamo" 그룹에 배치했다는 정도로 받아들이면 되겠습니다.




다시 문제로 돌아와서, 그러니까 텍스트 박스에 글자를 입력할 때 'ㄱ' 글자만을 입력한 경우 유니코드 상의 값은 12593(0x3131: 한글 호환 자모의 'ㄱ')인 반면 검색해야 할 문자열에 포함된 글자들은 초성으로써의 'ㄱ'이기 때문에 값의 비교를 할 수 없다는 것입니다.

당연히 이 문제를 해결하려면 '정규화'를 해야 하고, 정규화 시 글자의 분해를 '정준 분해'가 아닌 '호환 분해'를 하면 됩니다. 따라서 다음과 같이 코딩하는 것으로 해결할 수 있습니다.

{
    string txt1 = "ㄱ";
    string txt2 = "각";

    String nfd = txt1.Normalize(System.Text.NormalizationForm.FormKD);
    String nfc = txt2.Normalize(System.Text.NormalizationForm.FormKD);

    Console.WriteLine(nfd + ": " + (int)nfd[0]);
    Console.WriteLine(nfc[0] + ": " + (int)nfc[0]);
}

/*
출력 결과:

ㄱ: 4352
ㄱ: 4352
*/

보는 바와 같이 2개 모두 (단 자음으로서의 'ㄱ'이 아닌) '초성'으로서의 'ㄱ'으로 값을 비교할 수 있습니다. 자바의 경우에도 Normalizer.normalize 메서드를 지원하므로 Normalizer.Form.NFD 옵션으로 분해해 해결할 수 있습니다.




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 10/5/2018]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 



2018-10-04 12시33분
[키모] 혹시 반대로 4352의 값을 12593으로 할려면 어떻게 해야하나요?string txt2 = "각"을
String nfc = txt2.Normalize(System.Text.NormalizationForm.FormD);을 했을경우 4352로
나오던데 혹시 반대로 할려면 어떻게 해야할까요?
[guest]
2018-10-04 01시04분
[정환] "각"을 초성 중성 종성으로 분리해서 유니코드로 캐스팅하면 되지 않을까요?
[guest]
2018-10-04 06시45분
[키모] 저 자체가 같은 유니코드인데 값이 다르다는 말씀이신거 같은거 같은데 캐스팅이랑은 다르지 않을까요?
[guest]
2018-10-05 10시43분
다음의 글을 참고하세요.

유니코드와 한글 - "Hangul Compatibility Jamo"
; http://www.sysnet.pe.kr/2/0/11724
정성태
2018-10-07 03시56분
[키모] 아 감사합니다 확인해보겠습니다. :)
[guest]

... 136  137  138  139  [140]  141  142  143  144  145  146  147  148  149  150  ...
NoWriterDateCnt.TitleFile(s)
1589정성태1/14/201434376Windows: 85. 컴퓨터를 껐는데도 어느 순간 자동으로 켜진다면? [2]
1588정성태1/14/201431128Windows: 84. 윈도우 7/8 - 메뉴 항목이 잔상으로 남는 문제
1587정성태1/14/201427070디버깅 기술: 60. NT 서비스가 시작하자마자 디버거를 연결시키는 방법 (2)
1586정성태1/14/201428716디버깅 기술: 59. NT 서비스가 시작하자마자 디버거를 연결시키는 방법 (1) [1]
1585정성태1/14/201431627VS.NET IDE: 84. Visual Studio를 이용한 파일 비교(diff)
1584정성태1/13/201433695Windows: 83. 윈도우 8 - UI가 있는 프로그램을 Local SYSTEM 권한의 세션 0 데스크톱에서 실행하는 방법
1583정성태1/13/201432069Windows: 82. 윈도우 8 - "Interactive Services Detection" 서비스 시작하는 방법 [1]
1582정성태1/12/201430371개발 환경 구성: 210. 원격 데스크톱(RDP) 접속 프로그램 - Royal TS [1]
1581정성태1/12/201431742.NET Framework: 408. 자바와 닷넷의 제네릭 차이점 - 중간 언어 및 공변/반공변 처리 [8]
1580정성태1/12/201441751.NET Framework: 407. 닷넷 사용자 정의 예외 클래스의 최소 구현 코드 [1]
1579정성태1/12/201423602오류 유형: 207. System.ArgumentException was unhandled - Message=[net_WebHeaderInvalidControlChars]
1578정성태1/11/201435405개발 환경 구성: 209. Fiddler에서 WebSocket 통신을 모니터링하는 방법 [1]
1577정성태1/11/201425414오류 유형: 206. WriteFile Win32API 사용 시 비정상 종료 현상 [3]
1576정성태1/11/201443392Windows: 81. 긴 이름의 파일/폴더 삭제하는 법 [5]
1575정성태1/11/201423435오류 유형: 205. Exception calling "Provision" with "0" argument(s): "The timer job did not complete running within the allotted time."
1574정성태1/11/201425755오류 유형: 204. An unhandled exception ('System.Security.Cryptography.CryptographicException') occurred in OWSTIMER.EXE
1573정성태1/11/201423685오류 유형: 203. 이벤트 로그 에러 - MsiInstaller에서 Chart Controls 설치 관련 오류 발생
1572정성태1/9/201427156.NET Framework: 406. CoreLab - OraDirect .NET 사용법
1571정성태1/9/201423179.NET Framework: 405. override 메서드가 정의된 타입의 인스턴스로 base 메서드를 호출하는 방법 - 두 번째 이야기
1570정성태1/9/201426797Math: 11. C# 시뮬레이션 - 몬티홀 게임파일 다운로드1
1569정성태1/8/201423786Windows: 80. 윈도우 서버 백업의 복원하는 옵션 설명
1568정성태1/8/201424560오류 유형: 202. Hyper-V 서비스 시작 오류 - Not enough storage is available to complete this operation.
1567정성태1/8/201493990기타: 40. 오피스 2013 라이선스 리셋하는 방법 [5]
1566정성태1/7/201424852Windows: 79. 윈도우 8 - 스카이드라이브(skydrive)의 Online/Offline 동기화 방식 [1]
1565정성태1/3/201423345.NET Framework: 404. 리플렉션을 이용해 닷넷 LicenseManager를 우회할 수 있는 사례
1564정성태1/3/201423907.NET Framework: 403. override 메서드가 정의된 타입의 인스턴스로 base 메서드를 호출하는 방법파일 다운로드1
... 136  137  138  139  [140]  141  142  143  144  145  146  147  148  149  150  ...