Microsoft MVP성태의 닷넷 이야기
.NET Framework: 296. 괜찮은 문자열 해시함수? - 두 번째 이야기 [링크 복사], [링크+제목 복사],
조회: 27441
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
(연관된 글이 2개 있습니다.)

괜찮은 문자열 해시 함수? - 두 번째 이야기

이전 이야기에 대해서 더 할 이야기가 생겼군요. ^^

괜찮은 문자열 해시 함수?
; https://www.sysnet.pe.kr/2/0/1222

아무래도 무작위 문자열을 고르는 것이 테스트의 신뢰도를 떨어뜨리는 것 같고, 저 역시 좀 더 현실적인 테스트가 있으면 좋지 않을까 생각해서 이번엔 문제를 좀 골라봤습니다.

파일을 4개를 만들었는데요.

  • 영문 성경 텍스트 파일 (http://ebible.org/web/index.htm)
  • 한글 성경 텍스트 파일 (http://jwch.net/bbs/board.php?bo_table=util&wr_id=30)
  • C# 소스 코드 파일 (All-In-One Code Framework의 소스 파일)
  • 크롬 소스 코드 파일 중에서 50MB 분량만 취합

정말 x65599 해시의 경우 '영문 성격 텍스트 파일'의 경우에 아무런 충돌도 없었습니다. 하지만... 완벽한 해시가 어디있겠습니까? ^^ '한글 성경'에서는 충돌이 발생하더군요.

암튼... 테스트는 5가지 해시 방식에 대해서 진행했습니다.

  • x65599: http://www.gamedevforever.com/50 글에서 가져온 해시 코드
  • x65599 (마지막 shift 제거): "x65599" 코드 중에서 마지막 return 문에서 hash 값을 그대로 반환하도록 수정
  • 0xEDB88320: 지난번 글에서 소개한 0xEDB88320
  • 0xEDB8832F: 0xEDB88320의 값에 '0x0F'를 더한 숫자를 사용
  • .NET 4.0 GetHashCode: .NET 4.0의 string 타입에서 기본 제공되는 GetHashCode 사용

텍스트 파일이 사실 크기만 컸지, 고유 단어수를 계산해 보면 375,719 밖에 되지 않았기에 '현실(?)'을 많이 반영한 것 같지는 않지만 테스트를 아니한 것보다는 나으므로 ^^ 그냥 진행을 했습니다.

결과는...? 다음과 같습니다.

전체 워드 수: 375,719

x65599: 
    * 걸린 시간 9,573 ms
    * 충돌: 39 (0.0104 %)

x65599 (마지막 shift 제거):
    * 걸린 시간 9,309 ms
    * 충돌: 22 (0.0059 %)

0xEDB88320:
    * 걸린 시간 9,897 ms
    * 충돌 81,139 (21.5957%)

0xEDB8832F:
    * 걸린 시간 9,442 ms
    * 충돌 16 (0.0043%)

.NET 4.0 GetHashCode:
    * 걸린 시간 9,546 ms
    * 충돌 34 (0.0090%)

재미있는 결과가 나왔습니다.

  • 지난번의 무작위 테스트를 훌륭하게 통과한 0xEDB88320 값이 이번에는 20%가 넘는 충돌을 보임.
  • x65599는 여전히 shift 구문을 제거한 반환문이 더 빠르고 충돌도 낮음.

0xEDB88320 값이 저를 실망시키는군요. ^^; 오히려, 별다른 기대 없이 0xF 값을 더한 0xEDB8832F 숫자를 이용한 해시가 좋은 결과를 보여주고 있습니다. (이래서... 해시 코드는 해당 업무 도메인에 대한 문자열 셋으로 테스트가 필요한 것입니다. ^^)

그렇다면, 여기서 1등을 한 "0xEDB8832F"와 "shift 없는 x65599"에 대해서 지난번 글의 무작위 문자열 테스트 결과를 비교해 보면 어떨까요?

총 단어수 162,539,696

shift 제거한 hash
    * 걸린 시간 50,091 ms
    * 충돌 20,820,228 (12%)

0xEDB8832F:
    * 걸린 시간 53,372 ms
    * 충돌 2,807,510 (1.73%)

비록 0xEDB8832F 해시 함수가 0xEDB88320에 비해서 충돌이 더 발생하긴 했지만, '텍스트 파일' 실험의 결과와 종합해 보면 더욱 우수하기 때문에 용서가 됩니다.

아래는 이렇게 해서 최종적으로 만들어진 0xEDB88320 해시 함수입니다.

static int hash4(string word)
{
    uint hash = 0;
    int len = word.Length;
    int ch = 0;

    unchecked
    {
        uint poly = 0xEDB8832F;
        for (int i = 0; i < len; i++)
        {
            hash = (hash << 1) | (hash >> (32 - 1));

            ch = word[i];
            hash = (uint)(poly * hash + ch);
        }
    }

    return (int)hash;
}

역시 이번에도 여러분이 테스트를 할 수 있도록 소스 코드와 데이터 파일을 첨부했습니다.




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 7/10/2021]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 



2012-01-20 12시25분
꿀보("http://blog.naver.com/gloryo") 님의 정보에 의하면 x65599 방식이 윈도우 XP 부터 기본 지원되는 방식이라고 합니다. 실제로 찾아보니 RtlHashUnicodeString 의 도움말에서 HASH_STRING_ALGORITHM_X65599 옵션을 볼 수 있고 그것이 기본값이라고 설명되어 있습니다.

RtlHashUnicodeString routine
; http://msdn.microsoft.com/en-us/library/windows/hardware/ff561915(v=vs.85).aspx

와~~~ x65599 해쉬가 꽤나 유명한 것이었군요. ^^
정성태

... 106  107  108  109  110  [111]  112  113  114  115  116  117  118  119  120  ...
NoWriterDateCnt.TitleFile(s)
11150정성태2/21/201719353.NET Framework: 645. Visual Studio Fakes 기능에서 Shim... 클래스가 생성되지 않는 경우 [5]
11149정성태2/21/201723057오류 유형: 378. A 64-bit test cannot run in a 32-bit process. Specify platform as X64 to force test run in X64 mode on X64 machine.
11148정성태2/20/201721974.NET Framework: 644. AppDomain에 대한 단위 테스트 시 알아야 할 사항
11147정성태2/19/201721206오류 유형: 377. Windows 10에서 Fake 어셈블리를 생성하는 경우 빌드 시 The type or namespace name '...' does not exist in the namespace 컴파일 오류 발생
11146정성태2/19/201719901오류 유형: 376. Error VSP1033: The file '...' does not contain a recognized executable image. [2]
11145정성태2/16/201721356.NET Framework: 643. 작업자 프로세스(w3wp.exe)가 재시작되는 시점을 알 수 있는 방법 - 두 번째 이야기 [4]파일 다운로드1
11144정성태2/6/201724763.NET Framework: 642. C# 개발자를 위한 Win32 DLL export 함수의 호출 규약 (부록 1) - CallingConvention.StdCall, CallingConvention.Cdecl에 상관없이 왜 호출이 잘 될까요?파일 다운로드1
11143정성태2/5/201722111.NET Framework: 641. [Out] 형식의 int * 인자를 가진 함수에 대한 P/Invoke 호출 방법파일 다운로드1
11142정성태2/5/201730135.NET Framework: 640. 닷넷 - 배열 크기의 한계 [2]파일 다운로드1
11141정성태1/31/201724421.NET Framework: 639. C# 개발자를 위한 Win32 DLL export 함수의 호출 규약 (4) - CLR JIT 컴파일러의 P/Invoke 호출 규약 [1]파일 다운로드1
11140정성태1/27/201720170.NET Framework: 638. RSAParameters와 RSA파일 다운로드1
11139정성태1/22/201722897.NET Framework: 637. C# 개발자를 위한 Win32 DLL export 함수의 호출 규약 (3) - x64 환경의 __fastcall과 Name mangling [1]파일 다운로드1
11138정성태1/20/201721193VS.NET IDE: 113. 프로젝트 생성 시부터 "Enable the Visual Studio hosting process" 옵션을 끄는 방법 - 두 번째 이야기 [3]
11137정성태1/20/201719857Windows: 135. AD에 참여한 컴퓨터로 RDP 연결 시 배경 화면을 못 바꾸는 정책
11136정성태1/20/201719062오류 유형: 375. Hyper-V 내에 구성한 Active Directory 환경의 시간 구성 방법 - 두 번째 이야기
11135정성태1/20/201720055Windows: 134. Windows Server 2016의 작업 표시줄에 있는 시계가 사라졌다면? [1]
11134정성태1/20/201727450.NET Framework: 636. System.Threading.Timer를 이용해 타이머 작업을 할 때 유의할 점 [5]파일 다운로드1
11133정성태1/20/201723586.NET Framework: 635. C# 개발자를 위한 Win32 DLL export 함수의 호출 규약 (2) - x86 환경의 __fastcall [1]파일 다운로드1
11132정성태1/19/201735108.NET Framework: 634. C# 개발자를 위한 Win32 DLL export 함수의 호출 규약 (1) - x86 환경에서의 __cdecl, __stdcall에 대한 Name mangling [1]파일 다운로드1
11131정성태1/13/201724001.NET Framework: 633. C# - IL 코드 분석을 위한 팁 [2]
11130정성태1/11/201724534.NET Framework: 632. x86 실행 환경에서 SECURITY_ATTRIBUTES 구조체를 CreateEvent에 전달할 때 예외 발생파일 다운로드1
11129정성태1/11/201728903.NET Framework: 631. async/await에 대한 "There Is No Thread" 글의 부가 설명 [9]파일 다운로드1
11128정성태1/9/201723297.NET Framework: 630. C# - Interlocked.CompareExchange 사용 예제 [3]파일 다운로드1
11127정성태1/8/201722914기타: 63. (개발자를 위한) Visual Studio의 "with MSDN" 라이선스 설명
11126정성태1/7/201727616기타: 62. Edge 웹 브라우저의 즐겨찾기(Favorites)를 편집/백업/복원하는 방법 [1]파일 다운로드1
11125정성태1/7/201724477개발 환경 구성: 310. IIS - appcmd.exe를 이용해 특정 페이지에 클라이언트 측 인증서를 제출하도록 설정하는 방법
... 106  107  108  109  110  [111]  112  113  114  115  116  117  118  119  120  ...