Microsoft MVP성태의 닷넷 이야기
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
 
(연관된 글이 1개 있습니다.)

특정 단어로 시작하거나/끝나는 문자열을 포함/제외하는 정규 표현식 - Look-around

우선, 검색을 해보면 다음의 Q&A 글이 나오는데요,

Regular expression for a string that does not start with a sequence
; https://stackoverflow.com/questions/899422/regular-expression-for-a-string-that-does-not-start-with-a-sequence

"tbd_"로 시작하지 않는 문자열을 선택하고 싶다는 질문에 대해 별을 382개 받은 표현식을 보면 "negative look-ahead"를 사용해야 한다면서 다음의 식을 제공합니다.

^(?!tbd_).+

실제로 이것은 잘 동작합니다.

string exp = @"^(?!tbd_).+";

Regex urlRegex = new Regex(exp);

Console.WriteLine(urlRegex.IsMatch("tbd_test232")); // False
Console.WriteLine(urlRegex.IsMatch("test232")); // True
Console.WriteLine(urlRegex.IsMatch("232")); // True

좀 더 알아보기 전에 look-around라고 불리는 4가지 용어에 대한 정리가 필요합니다. 이에 대해 다음의 글이 아주 잘 정리해 주고 있는데요,

정규표현식 Lookahead, Lookbehind 기능 이해하기
; https://elvanov.com/2388

Lookahead and lookbehind
; https://javascript.info/regexp-lookahead-lookbehind

첫 번째 글에 각각의 positive/negative, lookahead/lookbehind를 다음과 같은 표 하나로 잘 표현해 주었습니다.

X(?=Y) Positive lookahead X 다음에 Y가 있는 경우
X(?!Y) Negative lookahead X 다음에 Y가 없는 경우
(?<=Y)X Positive lookbehind Y에 이어 X가 나오는 경우
(?<!Y)X Negative lookbehind Y 없이 X가 나오는 경우

위에서는, ?=, ?!, ?<=, ?<!에 대해 보기 좋게 앞/뒤의 위치를 바꾸고 있지만 실제로는 위치에 상관이 없는 것 같습니다. 일례로, https://regexr.com/ 사이트에서는 각각의 식 표현을 무조건 앞에다 두고 있으며,

positive lookahead  (?=ABC)
negative lookahead  (?!ABC)
positive lookbehind (?<=ABC)
negative lookbehind (?<!ABC)

마이크로소프트의 문서에서는,

Regular Expression Language - Quick Reference
; https://learn.microsoft.com/en-us/dotnet/standard/base-types/regular-expression-language-quick-reference

look-around 문법을 다음과 같이 뒤에다 예시를 위치시켜 놓았습니다.

(?= subexpression): Zero-width positive lookahead assertion. - 예제) \b\w+\b(?=.+and.+)
(?! subexpression): Zero-width negative lookahead assertion. - 예제) \b\w+\b(?!.+and.+)
(?<= subexpression): Zero-width positive lookbehind assertion. - 예제) \b\w+\b(?<=.+and.+)
(?<! subexpression): Zero-width negative lookbehind assertion. - 예제) \b\w+\b(?<!.+and.+)

저런 것을 보면, 앞/뒤에 쓰이는 것은 별 상관이 없고 단지, ?=, ?!는 ahead이고, ?<=, ?<!는 behind라고 해석이 되는 듯합니다. (혹시 정확히 이 표현에 대해 아시는 분은 덧글 부탁드립니다. ^^)




그런데, 앞/뒤에 쓰일 수 있다고 해서 해석이 또 같은 것은 아닙니다. 가령 다음의 표현식은 "tbd" 문자열이 뒤에 오지 않는 234를 찾는 표현식인데,

// 이후 https://regexr.com/에서 테스트

입력: /234(?!tbd)/g
예제에서 정규식 일치 텍스트: (4 matches)
tbdtest234

test234

234

234tbd

tbd234

식 표현을 앞에다 두면 이번엔 모든 "234" 문자열이 선택됩니다.


입력: /(?!tbd)234/g
예제에서 정규식 일치 텍스트: (4 matches)
tbdtest234

test234

234

234tbd

tbd234

참... 이것을 어떻게 해석해야 할지 감이 잘 안 오는군요. ^^; 혹시 정규 표현식 도사가 계시다면 덧글 부탁드립니다. ^^




그런데, 혼란스러운 것이 한두 가지가 아닙니다. 예를 들어, "tbd_"로 시작하지 않는 문자열만을 선택하고 싶다는 질문에 대해 Stackoverflow에 있던 답변자가 제시한 해답은 "look-behind"가 아니라 오히려 "look-ahead" 방식의 해답이었습니다.

[negative look-ahead]

^(?!tbd_).+

즉, 의미로 따지자면 "tbd_" 문자열이 뒤에 오지 않는 문자열을 선택하는 것과 같습니다. 그런데 여기서 재미있는 점은, 실제로 저렇게 하면 "앞에 tbd_" 문자열이 없는 것만 선택해 준다는 것입니다. (대신 Multiline 속성을 함께 줘야 합니다.)


입력: /^(?!tbd_).+/gm
예제에서 정규식 일치 텍스트: (3 matches)
tbd_est234

test234

234

234tbd_

tbd_234

오히려 직관적으로는 "시작"의 내용을 제거하는 거니까, "Negative lookahead"가 아닌 "Negative lookbehind"가 맞습니다. 그래서 다음과 같이 정규식을 세우면,

입력: /^(?<!tbd_).+/gm
예제에서 정규식 일치 텍스트: (5 matches)
tbd_est234

test234

234

234tbd_

tbd_234

저렇게 모든 문자열이 선택됩니다. 어허~~~ 뭔 규칙이 저럴까요? ^^;




그렇다고 해서, 저 규칙이 아주 빗나가는 것도 아닙니다. "X"에 해당하는 조건이 ".+"와 같은 경우보다 좀 더 구체적이라면 예상한 대로 문자열 선택이 됩니다. 가령 "tbd_"로 시작하지 않는 234" 문자열을 선택하고 싶다면 다음과 같이 표현식을 테스트할 수 있습니다.

입력: /(?<!tbd_\w*)234/g
예제에서 정규식 일치 텍스트: (3 matches)
tbd_est234

test234

234

234tbd_

tbd_234

그리고, 저 수식은 위치를 바꿔 "234(?<!tbd_\w*)"라고 설정해도 동일하게 나옵니다. 마찬가지로, "뒤에 tbd_가 없는 234" 문자열을 선택하는 것은 이렇게 할 수 있습니다.

입력: /234(?!tbd_\w*)/g
예제에서 정규식 일치 텍스트: (4 matches)
tbd_est234

test234

234

234tbd_

tbd_234

그런데, 이번에는 그 순서를 바꾸면 다음과 같이 선택이 달라집니다.

입력: /(?!tbd_\w*)234/g
예제에서 정규식 일치 텍스트: (5 matches)
tbd_est234

test234

234

234tbd_

tbd_234

한 마디로, 그냥 234 문자열은 모두 선택이 되는데 "(?!tbd_\w*)" 조건을 주는 것이 의미가 없습니다. 저렇게 보면, look-ahead 조건은 뒤에 오는 것이, look-behind 조건은 앞에 오는 것이 맞는 것 같습니다.

이 외에도, "정규 표현식 Lookahead, Lookbehind 기능 이해하기" 글에 lookaround의 규칙이 "결과가 소모되지 않는다"라는 설명을 하고 있으니, 이에 대해 모르시는 분은 꼭 저 글을 읽어보시고 이참에 눈에 익혀 두시는 것을 권장합니다. ^^




참고로, C#의 코딩 결과도 regexr.com과 (위의 예제 중 이해할 수 없는 동작들까지 모두) 동일합니다. 그런 걸로 봐서는 뭔가 체계적으로 정규 표현식을 접근하면 저 이상한 규칙들이 자연스럽게 해석될 수 있을 듯한데... 일단 이번엔 필요한 정규 표현식은 얻었으니 여기까지만! ^^




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 3/16/2023]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... 46  47  48  49  50  51  52  53  54  55  56  [57]  58  59  60  ...
NoWriterDateCnt.TitleFile(s)
12222정성태6/3/202010360VS.NET IDE: 146. error information: "CryptQueryObject" (-2147024893/0x80070003)
12221정성태6/3/202010102Windows: 170. 비어 있지 않은 디렉터리로 symbolic link(junction) 연결하는 방법
12220정성태6/3/202012600.NET Framework: 907. C# DLL로부터 TLB 및 C/C++ 헤더 파일(TLH)을 생성하는 방법
12219정성태6/1/202011681.NET Framework: 906. C# - lock (this), lock (typeof(...))를 사용하면 안 되는 이유파일 다운로드1
12218정성태5/27/202011650.NET Framework: 905. C# - DirectX 게임 클라이언트 실행 중 키보드 입력을 감지하는 방법 [3]
12217정성태5/24/202010063오류 유형: 615. Transaction count after EXECUTE indicates a mismatching number of BEGIN and COMMIT statements. Previous count = 0, current count = 1.
12216정성태5/15/202013242.NET Framework: 904. USB/IP PROJECT를 이용해 C#으로 USB Keyboard 가상 장치 만들기 [14]파일 다운로드1
12215정성태5/12/202018363개발 환경 구성: 490. C# - (Wireshark의) USBPcap을 이용한 USB 패킷 모니터링 [10]파일 다운로드1
12214정성태5/5/202010610개발 환경 구성: 489. 정식 인증서가 있는 경우 Device Driver 서명하는 방법 (2) - UEFI/SecureBoot [1]
12213정성태5/3/202012286개발 환경 구성: 488. (User-mode 코드로 가상 USB 장치를 만들 수 있는) USB/IP PROJECT 소개
12212정성태5/1/20209912개발 환경 구성: 487. UEFI / Secure Boot 상태인지 확인하는 방법
12211정성태4/27/202012243개발 환경 구성: 486. WSL에서 Makefile로 공개된 리눅스 환경의 C/C++ 소스 코드 빌드
12210정성태4/20/202012697.NET Framework: 903. .NET Framework의 Strong-named 어셈블리 바인딩 (1) - app.config을 이용한 바인딩 리디렉션 [1]파일 다운로드1
12209정성태4/13/202010725오류 유형: 614. 리눅스 환경에서 C/C++ 프로그램이 Segmentation fault 에러가 발생한 경우 (2)
12208정성태4/12/202010137Linux: 29. 리눅스 환경에서 C/C++ 프로그램이 Segmentation fault 에러가 발생한 경우
12207정성태4/2/20209119스크립트: 19. Windows PowerShell의 NonInteractive 모드
12206정성태4/2/202011444오류 유형: 613. 파일 잠금이 바로 안 풀린다면? - The process cannot access the file '...' because it is being used by another process.
12205정성태4/2/20208806스크립트: 18. Powershell에서는 cmd.exe의 명령어를 지원하진 않습니다.
12204정성태4/1/20208629스크립트: 17. Powershell 명령어에 ';' (semi-colon) 문자가 포함된 경우
12203정성태3/18/202010711오류 유형: 612. warning: 'C:\ProgramData/Git/config' has a dubious owner: '...'.
12202정성태3/18/202013270개발 환경 구성: 486. .NET Framework 프로젝트를 위한 GitLab CI/CD Runner 구성
12201정성태3/18/202011092오류 유형: 611. git-credential-manager.exe: Using credentials for username "Personal Access Token". [1]
12200정성태3/18/202011480VS.NET IDE: 145. NuGet + Github 라이브러리 디버깅 관련 옵션 3가지 - "Enable Just My Code" / "Enable Source Link support" / "Suppress JIT optimization on module load (Managed only)"
12199정성태3/17/20209299오류 유형: 610. C# - CodeDomProvider 사용 시 Unhandled Exception: System.IO.DirectoryNotFoundException: Could not find a part of the path '...\f2_6uod0.tmp'.
12198정성태3/17/202012102오류 유형: 609. SQL 서버 접속 시 "Cannot open user default database. Login failed."
12197정성태3/17/202011247VS.NET IDE: 144. .NET Core 콘솔 응용 프로그램을 배포(publish) 시 docker image 자동 생성 - 두 번째 이야기 [1]
... 46  47  48  49  50  51  52  53  54  55  56  [57]  58  59  60  ...