(연관된 글이 2개 있습니다.)

string.GetHashCode는 hash 값을 cache 할까?

잊혀져 가는 GetHashCode에 대한 자료들을 같이 소개도 할 겸,

순환참조와 XmlSerializer
; https://www.sysnet.pe.kr/2/0/751

Dictionary.Get(A) 대신 Dictionary.Get(A.GetHashCode())를 사용해서는 안되는 이유
; https://www.sysnet.pe.kr/2/0/889

이번에는 오늘 문득 코딩을 하다 궁금한 점이 있어서 그 결과를 써봅니다. (회사가 성능 관련 문제를 다루다 보니, 제가 만드는 코드 하나 하나에 직업병이 생기더군요. ^^)

보통 GetHashCode 사용에 부담스러울 때가 있는데요. 바로, "문자열"에 대해 GetHashCode를 호출하는 경우일 것입니다. 왜냐하면, 해시값을 내기 위해 모든 문자를 열람하게 되기 때문에 문자열이 커질수록 속도에 영향을 미칠 수 있기 때문입니다.

그렇다면, Immutable 속성의 string 타입에서 GetHashCode를 내부적으로 값을 cache하고 있지 않을까요? 어떻게 생각하세요?

답은? Cache 하고 있지 않습니다. ".NET Reflector"를 이용하여 System.String.GetHashCode의 코드를 살펴보면, 다음과 같이 매번 모든 문자열을 열람하는 것을 볼 수 있습니다.

public override unsafe int GetHashCode()
{
    fixed (char* str = ((char*) this))
    {
        char* chPtr = str;
        int num = 0x15051505;
        int num2 = num;
        int* numPtr = (int*) chPtr;
        for (int i = this.Length; i > 0; i -= 4)
        {
            num = (((num << 5) + num) + (num >> 0x1b)) ^ numPtr[0];
            if (i <= 2)
            {
                break;
            }
            num2 = (((num2 << 5) + num2) + (num2 >> 0x1b)) ^ numPtr[1];
            numPtr += 2;
        }
        return (num + (num2 * 0x5d588b65));
    }
}

그런데, 위에서 보니 재미있는 코드가 눈에 띕니다. 바로, 내부적으로 관리하는 char* 버퍼를 int* 로 형변환 해서 사용한다는 점입니다. 이 때문에 문자열 길이가 4byte인 경우 루프를 2번 돌지 않고 1번 만에 처리해 버립니다. 오호~~~ 속도 향상을 위해 꽤나 고민한 흔적이 엿보입니다. ^^

그렇다면? C#의 문자열은 최소 4byte 간격으로 메모리를 패딩하고 있음을 짐작하게 됩니다. 정말 그런지 확인해 볼까요?

C#을 실행하고 메모리 윈도우를 통해서 조사해 보면 알 수 있을 것입니다.

어디... 문자열이 "t" 값만을 갖고 있는 경우를 볼까요?

== "t"인 경우 ===
74 00 00 00 00 00 00 80 28 ac 3a 00 01 00 00 00 71 00 00 00 00 00 00 00 00 00  t......€(￢:.....q.........
00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00

유니코드이기 때문에 내부적으로 "t" 값은 "74 00" 2바이트를 차지합니다. 그리고 C/C++에서의 "NULL" 표시를 위해 "0" 값을 사용하는데 이것 역시 2바이트를 차지하므로 사실상 "t" 한 글자를 표현하기 위해 "74 00 00 00"과 같이 4바이트를 필요로 합니다.

그럼 이번에는 "te"와 같이 두 글자로 늘여볼까요?

74 00 65 00 00 00 00 00 00 00 00 80 28 ac 3f 00 01 00 00 00 71 00 00 00 00 00  t.e........€(￢?.....q.....
00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00

"te"를 표현하기 위해 "74 00 65 00"이 소모되었지만, 널 문자가 빠졌기 때문에 "00 00"이 필요합니다. 하지만 4byte 정렬이기 때문에 사실상 "te" == "74 00 65 00 00 00 00 00"이 됩니다. 이렇게 판단할 수 있는 또 다른 근거로는, 그 이후에 "t"에서와 마찬가지로 "00 00 00 80" 값이 규칙적으로 나온다는 것을 관찰할 수 있기 때문입니다.

마지막으로 "test"로 해보면... 이제 결과를 예측할 수 있겠지요. ^^

74 00 65 00 73 00 74 00 00 00 00 00 00 00 00 80 28 ac 4d 00 08 00 00 00 71 00  t.e.s.t........€(￢M.....q.
77 00 65 00 72 00 74 00 65 00 73 00 74 00 00 00 00 00 00 00 00 00 00 00 00 00

GetHashCode가 값을 Cache 하고 있는지를 알아보려다가... 어느새 String의 내부 문자열 정렬을 알아보는 것 까지 와버렸군요. ^^

참고로, .NET 4.0의 string.GetHashCode를 외부로 빼서 구현해 보면 다음과 같습니다.

static unsafe void Main(string[] args)
{
    string txt = "tes";

    int hash1 = GetHashCode(txt);
    int hash2 = txt.GetHashCode();

    Console.WriteLine(hash1); // -175665545 (.NET 4.0인 경우.)
    Console.WriteLine(hash2); // -175665545
    Console.WriteLine(hash1 == hash2); // True
}

static unsafe int GetHashCode(string txt)
{
    fixed (char* str = txt)
    {
        char* chPtr = str;
        int num = 0x15051505;
        int num2 = num;
        int* numPtr = (int*)chPtr;
        for (int i = txt.Length; i > 0; i -= 4)
        {
            num = (((num << 5) + num) + (num >> 0x1b)) ^ numPtr[0];
            if (i <= 2)
            {
                break;
            }
            num2 = (((num2 << 5) + num2) + (num2 >> 0x1b)) ^ numPtr[1];
            numPtr += 2;
        }

        return (num + (num2 * 0x5d588b65));
    }
}

[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]

[최초 등록일: 10/20/2011]
[최종 수정일: 2/11/2023]

이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.

by SeongTae Jeong, mailto:techsharer at outlook.com

No	Writer	Date	Cnt.	Title	File(s)
13635	정성태	5/29/2024	10971	Phone: 19. C# MAUI - 안드로이드 "Share" 대상으로 등록하는 방법
13634	정성태	5/24/2024	11684	Phone: 18. C# MAUI - 안드로이드 플랫폼에서의 Activity 제어 [1]
13633	정성태	5/22/2024	10996	스크립트: 64. 파이썬 - ASGI를 만족하는 최소한의 구현 코드
13632	정성태	5/20/2024	9859	Phone: 17. C# MAUI - Android 내에 Web 서비스 호스팅
13631	정성태	5/19/2024	10940	Phone: 16. C# MAUI - /Download 등의 공용 디렉터리에 접근하는 방법 [1]
13630	정성태	5/19/2024	9937	닷넷: 2263. C# - Thread가 Task보다 더 빠르다는 어떤 예제(?)
13629	정성태	5/18/2024	10418	개발 환경 구성: 710. Android - adb.exe를 이용한 파일 전송
13628	정성태	5/17/2024	9661	개발 환경 구성: 709. Windows - WHPX(Windows Hypervisor Platform)를 이용한 Android Emulator 가속
13627	정성태	5/17/2024	9814	오류 유형: 904. 파이썬 - UnicodeEncodeError: 'ascii' codec can't encode character '...' in position ...: ordinal not in range(128)
13626	정성태	5/15/2024	11218	Phone: 15. C# MAUI - MediaElement Source 경로 지정 방법	1
13625	정성태	5/14/2024	10282	닷넷: 2262. C# - Exception Filter 조건(when)을 갖는 catch 절의 IL 구조
13624	정성태	5/12/2024	10018	Phone: 14. C# - MAUI에서 MediaElement 사용	1
13623	정성태	5/11/2024	9595	닷넷: 2261. C# - 구글 OAuth의 JWT (JSON Web Tokens) 해석	1
13622	정성태	5/10/2024	11510	닷넷: 2260. C# - Google 로그인 연동 (ASP.NET 예제)	1
13621	정성태	5/10/2024	10853	오류 유형: 903. IISExpress - Failed to register URL "..." for site "..." application "/". Error description: Cannot create a file when that file already exists. (0x800700b7)
13620	정성태	5/9/2024	10095	VS.NET IDE: 190. Visual Studio가 node.exe를 경유해 Edge.exe를 띄우는 경우
13619	정성태	5/7/2024	10842	닷넷: 2259. C# - decimal 저장소의 비트 구조 [1]	1
13618	정성태	5/6/2024	9742	닷넷: 2258. C# - double (배정도 실수) 저장소의 비트 구조	1
13617	정성태	5/5/2024	11670	닷넷: 2257. C# - float (단정도 실수) 저장소의 비트 구조	1
13616	정성태	5/3/2024	9733	닷넷: 2256. ASP.NET Core 웹 사이트의 HTTP/HTTPS + Dual mode Socket (IPv4/IPv6) 지원 방법	1
13615	정성태	5/3/2024	11665	닷넷: 2255. C# 배열을 Numpy ndarray 배열과 상호 변환
13614	정성태	5/2/2024	11384	닷넷: 2254. C# - COM 인터페이스의 상속 시 중복으로 메서드를 선언
13613	정성태	5/1/2024	9970	닷넷: 2253. C# - Video Capture 장치(Camera) 열거 및 지원 포맷 조회	1
13612	정성태	4/30/2024	11189	오류 유형: 902. Visual Studio - error MSB3021: Unable to copy file
13611	정성태	4/29/2024	10003	닷넷: 2252. C# - GUID 타입 전용의 UnmanagedType.LPStruct - 두 번째 이야기	1
13610	정성태	4/28/2024	11054	닷넷: 2251. C# - 제네릭 인자를 가진 타입을 생성하는 방법 - 두 번째 이야기

AD BLOCK 해제 요청

string.GetHashCode는 hash 값을 cache 할까?