Microsoft MVP성태의 닷넷 이야기
닷넷: 2308. C# - ICU 라이브러리를 활용한 문자열의 대소문자 변환 [링크 복사], [링크+제목 복사],
조회: 3820
글쓴 사람
정성태 (seongtaejeong at
첨부 파일

(시리즈 글이 5개 있습니다.)
오류 유형: 848. .NET Core/5+ - Process terminated. Couldn't find a valid ICU package installed on the system

닷넷: 2153. C# - 사용자가 빌드한 ICU dll 파일을 사용하는 방법

C/C++: 184. C++ - ICU dll을 이용하는 예제 코드 (Windows)

C/C++: 185. C++ - 문자열의 대소문자를 변환하는 transform + std::tolower/toupper 방식의 문제점

닷넷: 2308. C# - ICU 라이브러리를 활용한 문자열의 대소문자 변환

C# - ICU 라이브러리를 활용한 문자열의 대소문자 변환

지난 글의,

C++ - 문자열의 대소문자를 변환하는 transform + std::tolower/toupper 방식의 문제점

C# 버전을 작성해 보겠습니다. ^^

우선, C#의 경우 .NET 5부터 ICU(International Components for Unicode) 라이브러리를 지원하는데요, 따라서 .NET Core 3.1 이하 버전에서는 (아마도 LCMapStringEx를 사용할 것이므로) 대/소문자 변환이 매끄럽지 않을 것이라고 예상할 수 있습니다.

실제로 테스트를 해볼까요? ^^

// .NET Core 3.1 이하 + Windows 11
using System;

internal class Program
    static void Main(string[] args)
        string text = "𐲀, ß, à, fl";

/* 출력 결과
𐲀, ß, à, fl
𐲀, ß, à, fl
𐲀, ß, À, fl

보는 바와 같이 '𐲀' 문자의 소문자 변환이 안 되었고, ß, fl 문자의 대문자 변환이 안 되었습니다.
동일한 예제를 .NET 5+ 버전에서 해보면 어떨까요?

// .NET Core 5 이상 + Windows 11
internal class Program
    static void Main(string[] args)
        string text = "𐲀, ß, à, fl";

/* 출력 결과
𐲀, ß, à, fl
𐳀, ß, à, fl
𐲀, ß, À, fl

그나마 이번엔 𐲀 문자의 소문자 처리는 되었지만, 여전히 ß, fl 문자의 대문자 변환이 안 되었습니다.

혹시, Windows 11에 기본 포함된 ICU Combined Library의 버전 차이 때문일까요? 기본적으로 (2024-11-03 기준) Windows 11에 포함된 icu.dll은 버전입니다. 반면 지난 글에서 테스트한 버전은 74였는데요, 혹시나 싶어 그 DLL들을 포함하고,

<Project Sdk="Microsoft.NET.Sdk">


        <None Include="..\lib\icudt74.dll" Link="icudt74.dll">
        <None Include="..\lib\icuin74.dll" Link="icuin74.dll">
        <None Include="..\lib\icuio74.dll" Link="icuio74.dll">
        <None Include="..\lib\icutu74.dll" Link="icutu74.dll">
        <None Include="..\lib\icuuc74.dll" Link="icuuc74.dll">

        <RuntimeHostConfigurationOption Include="System.Globalization.AppLocalIcu" Value="74" />

빌드해 봤지만 결과는 변하지 않았습니다. 그렇다면, 아직 닷넷은 ICU 라이브러리를 100% 활용하고 있지는 않는 것 같습니다.

그런데, 문자열 비교를 해보면 더 재미있는 결과가 나옵니다. ^^;

Console.WriteLine(StringComparer.Create(CultureInfo.InvariantCulture, true).Compare("𐲀", "𐳀"));
Console.WriteLine(StringComparer.Create(CultureInfo.InvariantCulture, true).Compare("a", "A"));
Console.WriteLine(StringComparer.Create(CultureInfo.InvariantCulture, true).Compare("fl", "FL"));
Console.WriteLine(StringComparer.Create(CultureInfo.InvariantCulture, true).Compare("ß", "ẞ"));

/* 출력 결과

𐲀 문자의 경우 정작 소문자 변환은 성공했지만 ignoreCase 비교에서는 실패한 반면, fl, ß 2개의 문자는 오히려 대문자 변환은 실패했지만 ignoreCase 비교에서는 성공했습니다. ^^;

참고로, 윈도우에 기본 포함된 icu.dll이 제공하는 함수를 직접 이용하는 것도 가능합니다.

C:\temp> dumpbin /EXPORTS c:\windows\system32\icu.dll | findstr u_strToLower
        114   71 00008940 u_strToLower

따라서, 이렇게 interop을 하면,

using System.Globalization;
using System.Runtime.InteropServices;

internal unsafe class Program
    public static extern int u_strToLower(char* dest, int destCapacity, char* src, int srcLength, char* locale, int* pErrorCode);

    public static extern int u_strToUpper(char* dest, int destCapacity, char* src, int srcLength, char* locale, int* pErrorCode);

    static void Main(string[] args)
        string text = "𐲀, ß, à, fl";

        // U_ILLEGAL_ARGUMENT_ERROR = 1,     /**< Start of codes indicating failure */
        // U_BUFFER_OVERFLOW_ERROR   = 15,     /**< A result would not fit in the supplied buffer */
        // U_STRING_NOT_TERMINATED_WARNING = -124,/**< An output string could not be NUL-terminated because output length==destCapacity. */

            // ICU4C
            int errorCode = 0;

            fixed (char* src = text)
                int needBuffer = u_strToLower(null, 0, src, -1, null, &errorCode);
                errorCode = 0;
                char* dest = stackalloc char[needBuffer + 1];
                u_strToLower(dest, needBuffer + 1, src, -1, null, &errorCode);
                Console.WriteLine(new string(dest));

            // ICU4C
            int errorCode = 0;

            fixed (char* src = text)
                int needBuffer = u_strToUpper(null, 0, src, -1, null, &errorCode);
                errorCode = 0;
                char* dest = stackalloc char[needBuffer + 1];
                u_strToUpper(dest, needBuffer + 1, src, -1, null, &errorCode);
                Console.WriteLine(new string(dest));

/* 출력 결과
𐳀, ß, à, fl
𐲀, SS, À, FL

"C++ - ICU dll을 이용하는 예제 코드 (Windows)" 글에서 작성한 결과 그대로 나왔습니다.

만약, 윈도우가 기본 제공하는 icu.dll이 아닌 직접 빌드한 것을 사용하고 싶다면 u_strToLower의 경우 icuuc??dll에 있을 테니,

C:\temp> dumpbin /EXPORTS icuuc74.dll | findstr u_strToLower
       2358  935 000E0E20 u_strToLower_74

버전 번호를 EntryPoint로 명시해 사용하면 됩니다.

[DllImport("icuuc74.dll", EntryPoint = "u_strToLower_74")]
public static extern int u_strToLower(char* dest, int destCapacity, char* src, int srcLength, char* locale, int* pErrorCode);

[DllImport("icuuc74.dll", EntryPoint = "u_strToUpper_74")]
public static extern int u_strToUpper(char* dest, int destCapacity, char* src, int srcLength, char* locale, int* pErrorCode);

(첨부 파일은 이 글의 예제 코드를 포함합니다.)

[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[최초 등록일: ]
[최종 수정일: 11/3/2024]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at


댓글 작성자

2024-11-21 09시06분
대소문자 '변환'과 함께 따라오는 문제가 바로 대소문자 구분 없이 '검색'하는 것도 있군요. ^^

On locale-aware substring matching, either case-sensitive or case-insensitive

윈도우에서는 이를 위해 Find­NLS­String­Ex 함수를 제공하고 있지만, "Windows globalization" 팀조차도 이제는 ICU를 추천한다고 합니다.
2024-11-21 09시14분
What has case distinction but is neither uppercase nor lowercase?

유니코드에는, 대문자(Upper-case)도 아닌, 그렇다고 소문자(Lower-case)도 아닌 case가 있는데요, 바로 그 중간에 자리잡고 있는 "Title case"가 있다고! ^^;

1  [2]  3  4  5  6  7  8  9  10  11  12  13  14  15  ...
13846정성태12/17/20242045디버깅 기술: 208. Windbg로 알아보는 Trans/Soft PTE와 2가지 Page Fault 유형파일 다운로드1
13845정성태12/16/20242331디버깅 기술: 207. Windbg로 알아보는 PTE (_MMPTE)
13844정성태12/14/20242201디버깅 기술: 206. Windbg로 알아보는 PFN (_MMPFN)파일 다운로드1
13843정성태12/13/20242169오류 유형: 938. Docker container 내에서 빌드 시 error MSB3021: Unable to copy file "..." to "...". Access to the path '...' is denied.
13842정성태12/12/20242394디버깅 기술: 205. Windbg - KPCR, KPRCB
13841정성태12/11/20242316오류 유형: 937. error MSB4044: The "ValidateValidArchitecture" task was not given a value for the required parameter "RemoteTarget"
13840정성태12/11/20242179오류 유형: 936. msbuild - Your project file doesn't list 'win' as a "RuntimeIdentifier"
13839정성태12/11/20242121오류 유형: 936. msbuild - error CS1617: Invalid option '12.0' for /langversion. Use '/langversion:?' to list supported values.
13838정성태12/4/20242362오류 유형: 935. Windbg - Breakpoint 0's offset expression evaluation failed.
13837정성태12/3/20242377디버깅 기술: 204. Windbg - 윈도우 핸들 테이블 (3) - Windows 10 이상인 경우
13836정성태12/3/20242366디버깅 기술: 203. Windbg - x64 가상 주소를 물리 주소로 변환 (페이지 크기가 2MB인 경우)
13835정성태12/2/20242343오류 유형: 934. Azure - rm: cannot remove '...': Directory not empty
13834정성태11/29/20242453Windows: 275. C# - CUI 애플리케이션과 Console 윈도우 (Windows 10 미만의 Classic Console 모드인 경우)파일 다운로드1
13833정성태11/29/20242349개발 환경 구성: 737. Azure Web App에서 Scale-out으로 늘어난 리눅스 인스턴스에 SSH 접속하는 방법
13832정성태11/27/20242481Windows: 274. Windows 7부터 도입한 conhost.exe
13831정성태11/27/20242480Linux: 111. eBPF - BPF_MAP_TYPE_PERF_EVENT_ARRAY, BPF_MAP_TYPE_RINGBUF에 대한 다양한 용어들
13830정성태11/25/20242351개발 환경 구성: 736. 파이썬 웹 앱을 Azure App Service에 배포하기
13829정성태11/25/20242221스크립트: 67. 파이썬 - Windows 버전에서 함께 설치되는 py.exe
13828정성태11/25/20242269개발 환경 구성: 735. Azure - 압축 파일을 이용한 web app 배포 시 디렉터리 구분이 안 되는 문제파일 다운로드1
13827정성태11/25/20242320Windows: 273. Windows 환경의 파일 압축 방법 (tar, Compress-Archive)
13826정성태11/21/20242556닷넷: 2313. C# - (비밀번호 등의) Console로부터 입력받을 때 문자열 출력 숨기기(echo 끄기)파일 다운로드1
13825정성태11/21/20242522Linux: 110. eBPF / bpf2go - BPF_RINGBUF_OUTPUT / BPF_MAP_TYPE_RINGBUF 사용법
13824정성태11/20/20242593Linux: 109. eBPF / bpf2go - BPF_PERF_OUTPUT / BPF_MAP_TYPE_PERF_EVENT_ARRAY 사용법
13823정성태11/20/20242478개발 환경 구성: 734. Ubuntu에 docker, kubernetes (k3s) 설치
13822정성태11/20/20242336개발 환경 구성: 733. Windbg - VirtualBox VM의 커널 디버거 연결 시 COM 포트가 없는 경우
13821정성태11/18/20242599Linux: 108. Linux와 Windows의 프로세스/스레드 ID 관리 방식
1  [2]  3  4  5  6  7  8  9  10  11  12  13  14  15  ...