성태의 닷넷 이야기
홈 주인
모아 놓은 자료
프로그래밍
질문/답변
사용자 관리
사용자
메뉴
아티클
외부 아티클
유용한 코드
온라인 기능
MathJax 입력기
최근 덧글
[정성태] Working with Rust Libraries from C#...
[정성태] Detecting blocking calls using asyn...
[정성태] 아쉽게도, 커뮤니티는 아니고 개인 블로그입니다. ^^
[정성태] 질문이 잘 이해가 안 됩니다. 우선, 해당 소스코드에서 ILis...
[양승조
] var대신 dinamic으로 선언해서 해결은 했습니다. 맞는 해...
[양승조
] 또 막혔습니다. ㅠㅠ var list = props[i].Ge...
[양승조
] 아. 감사합니다. 어제는 안됐던것 같은데....정신을 차려야겠네...
[정성태] "props[i].GetValue(props[i])" 코드에서 ...
[정성태] 저렇게 조각 코드 말고, 실제로 재현이 되는 예제 프로젝트를 압...
[정성태] Modules 창(Ctrl+Shift+U)을 띄워서, 해당 Op...
글쓰기
제목
이름
암호
전자우편
HTML
홈페이지
유형
제니퍼 .NET
닷넷
COM 개체 관련
스크립트
VC++
VS.NET IDE
Windows
Team Foundation Server
디버깅 기술
오류 유형
개발 환경 구성
웹
기타
Linux
Java
DDK
Math
Phone
Graphics
사물인터넷
부모글 보이기/감추기
내용
<div style='display: inline'> <h1 style='font-family: Malgun Gothic, Consolas; font-size: 20pt; color: #006699; text-align: center; font-weight: bold'>특정 단어로 시작하거나/끝나는 문자열을 포함/제외하는 정규 표현식 - Look-around</h1> <p> 우선, 검색을 해보면 다음의 Q&A 글이 나오는데요,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > Regular expression for a string that does not start with a sequence ; <a target='tab' href='https://stackoverflow.com/questions/899422/regular-expression-for-a-string-that-does-not-start-with-a-sequence'>https://stackoverflow.com/questions/899422/regular-expression-for-a-string-that-does-not-start-with-a-sequence</a> </pre> <br /> "tbd_"로 시작하지 않는 문자열을 선택하고 싶다는 질문에 대해 별을 382개 받은 표현식을 보면 "negative look-ahead"를 사용해야 한다면서 다음의 식을 제공합니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > ^(?!tbd_).+ </pre> <br /> 실제로 이것은 잘 동작합니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > string exp = @"^(?!tbd_).+"; Regex urlRegex = new Regex(exp); Console.WriteLine(urlRegex.IsMatch("tbd_test232")); // False Console.WriteLine(urlRegex.IsMatch("test232")); // True Console.WriteLine(urlRegex.IsMatch("232")); // True </pre> <br /> 좀 더 알아보기 전에 look-around라고 불리는 4가지 용어에 대한 정리가 필요합니다. 이에 대해 다음의 글이 아주 잘 정리해 주고 있는데요,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 정규표현식 Lookahead, Lookbehind 기능 이해하기 ; <a target='tab' href='https://elvanov.com/2388'>https://elvanov.com/2388</a> Lookahead and lookbehind ; <a target='tab' href='https://javascript.info/regexp-lookahead-lookbehind'>https://javascript.info/regexp-lookahead-lookbehind</a> </pre> <br /> 첫 번째 글에 각각의 positive/negative, lookahead/lookbehind를 다음과 같은 표 하나로 잘 표현해 주었습니다.<br /> <br /> <table style="border-collapse: collapse;"> <tr> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">X(?=Y)</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Positive lookahead</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">X 다음에 Y가 있는 경우</td> </tr> <tr> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">X(?!Y)</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Negative lookahead</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">X 다음에 Y가 없는 경우</td> </tr> <tr> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">(?<=Y)X</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Positive lookbehind</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Y에 이어 X가 나오는 경우</td> </tr> <tr> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">(?<!Y)X</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Negative lookbehind</td> <td style="border: solid 1px gray; padding: 0.5em 1em 0.5em 1em;">Y 없이 X가 나오는 경우</td> </tr> </table> <br /> 위에서는, ?=, ?!, ?<=, ?<!에 대해 보기 좋게 앞/뒤의 위치를 바꾸고 있지만 실제로는 위치에 상관이 없는 것 같습니다. 일례로, <a target='tab' href='https://regexr.com/'>https://regexr.com/</a> 사이트에서는 각각의 식 표현을 무조건 앞에다 두고 있으며,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > positive lookahead (<span style='color: blue; font-weight: bold'>?=</span>ABC) negative lookahead (<span style='color: blue; font-weight: bold'>?!</span>ABC) positive lookbehind (<span style='color: blue; font-weight: bold'>?<=</span>ABC) negative lookbehind (<span style='color: blue; font-weight: bold'>?<!</span>ABC) </pre> <br /> 마이크로소프트의 문서에서는,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > Regular Expression Language - Quick Reference ; <a target='tab' href='https://learn.microsoft.com/en-us/dotnet/standard/base-types/regular-expression-language-quick-reference'>https://learn.microsoft.com/en-us/dotnet/standard/base-types/regular-expression-language-quick-reference</a> </pre> <br /> look-around 문법을 다음과 같이 뒤에다 예시를 위치시켜 놓았습니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > (?= subexpression): Zero-width positive lookahead assertion. - 예제) \b\w+\b<span style='color: blue; font-weight: bold'>(?=.+and.+)</span> (?! subexpression): Zero-width negative lookahead assertion. - 예제) \b\w+\b<span style='color: blue; font-weight: bold'>(?!.+and.+)</span> (?<= subexpression): Zero-width positive lookbehind assertion. - 예제) \b\w+\b<span style='color: blue; font-weight: bold'>(?<=.+and.+)</span> (?<! subexpression): Zero-width negative lookbehind assertion. - 예제) \b\w+\b<span style='color: blue; font-weight: bold'>(?<!.+and.+)</span> </pre> <br /> 저런 것을 보면, 앞/뒤에 쓰이는 것은 별 상관이 없고 단지, ?=, ?!는 ahead이고, ?<=, ?<!는 behind라고 해석이 되는 듯합니다. (혹시 정확히 이 표현에 대해 아시는 분은 덧글 부탁드립니다. ^^)<br /> <br /> <hr style='width: 50%' /><br /> <br /> 그런데, 앞/뒤에 쓰일 수 있다고 해서 해석이 또 같은 것은 아닙니다. 가령 다음의 표현식은 "tbd" 문자열이 뒤에 오지 않는 234를 찾는 표현식인데,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > // 이후 <a target='tab' href='https://regexr.com/'>https://regexr.com/</a>에서 테스트 입력: /234<span style='color: blue; font-weight: bold'>(?!tbd)</span>/g 예제에서 정규식 일치 텍스트: (4 matches) tbdtest<span style='color: blue; font-weight: bold'>234</span> test<span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span> 234tbd tbd<span style='color: blue; font-weight: bold'>234</span> </pre> <br /> 식 표현을 앞에다 두면 이번엔 모든 "234" 문자열이 선택됩니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /<span style='color: blue; font-weight: bold'>(?!tbd)</span>234/g 예제에서 정규식 일치 텍스트: (4 matches) tbdtest<span style='color: blue; font-weight: bold'>234</span> test<span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span>tbd tbd<span style='color: blue; font-weight: bold'>234</span> </pre> <br /> 참... 이것을 어떻게 해석해야 할지 감이 잘 안 오는군요. ^^; 혹시 정규 표현식 도사가 계시다면 덧글 부탁드립니다. ^^<br /> <br /> <hr style='width: 50%' /><br /> <br /> 그런데, 혼란스러운 것이 한두 가지가 아닙니다. 예를 들어, "tbd_"로 시작하지 않는 문자열만을 선택하고 싶다는 질문에 대해 Stackoverflow에 있던 답변자가 제시한 해답은 "look-behind"가 아니라 오히려 "look-ahead" 방식의 해답이었습니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > [negative look-ahead] ^(?!tbd_).+ </pre> <br /> 즉, 의미로 따지자면 "tbd_" 문자열이 뒤에 오지 않는 문자열을 선택하는 것과 같습니다. 그런데 여기서 재미있는 점은, 실제로 저렇게 하면 "앞에 tbd_" 문자열이 없는 것만 선택해 준다는 것입니다. (대신 Multiline 속성을 함께 줘야 합니다.)<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /^(?!tbd_).+/gm 예제에서 정규식 일치 텍스트: (3 matches) tbd_est234 <span style='color: blue; font-weight: bold'>test234</span> <span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234tbd_</span> tbd_234 </pre> <br /> 오히려 직관적으로는 "시작"의 내용을 제거하는 거니까, "Negative lookahead"가 아닌 "Negative lookbehind"가 맞습니다. 그래서 다음과 같이 정규식을 세우면,<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /^(<span style='color: blue; font-weight: bold'>?<!</span>tbd_).+/gm 예제에서 정규식 일치 텍스트: (5 matches) <span style='color: blue; font-weight: bold'>tbd_est234</span> <span style='color: blue; font-weight: bold'>test234</span> <span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234tbd_</span> <span style='color: blue; font-weight: bold'>tbd_234</span> </pre> <br /> 저렇게 모든 문자열이 선택됩니다. 어허~~~ 뭔 규칙이 저럴까요? ^^;<br /> <br /> <hr style='width: 50%' /><br /> <br /> 그렇다고 해서, 저 규칙이 아주 빗나가는 것도 아닙니다. "X"에 해당하는 조건이 ".+"와 같은 경우보다 좀 더 구체적이라면 예상한 대로 문자열 선택이 됩니다. 가령 "tbd_"로 시작하지 않는 234" 문자열을 선택하고 싶다면 다음과 같이 표현식을 테스트할 수 있습니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /(<span style='color: blue; font-weight: bold'>?<!</span>tbd_\w*)234/g 예제에서 정규식 일치 텍스트: (3 matches) tbd_est234 test<span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span>tbd_ tbd_234 </pre> <br /> 그리고, 저 수식은 위치를 바꿔 "234(?<!tbd_\w*)"라고 설정해도 동일하게 나옵니다. 마찬가지로, "뒤에 tbd_가 없는 234" 문자열을 선택하는 것은 이렇게 할 수 있습니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /234(<span style='color: blue; font-weight: bold'>?!</span>tbd_\w*)/g 예제에서 정규식 일치 텍스트: (4 matches) tbd_est<span style='color: blue; font-weight: bold'>234</span> test<span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span> 234tbd_ tbd_<span style='color: blue; font-weight: bold'>234</span> </pre> <br /> 그런데, 이번에는 그 순서를 바꾸면 다음과 같이 선택이 달라집니다.<br /> <br /> <pre style='margin: 10px 0px 10px 10px; padding: 10px 0px 10px 10px; background-color: #fbedbb; overflow: auto; font-family: Consolas, Verdana;' > 입력: /<span style='color: blue; font-weight: bold'>(?!tbd_\w*)</span>234/g 예제에서 정규식 일치 텍스트: (5 matches) tbd_est<span style='color: blue; font-weight: bold'>234</span> test<span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span> <span style='color: blue; font-weight: bold'>234</span>tbd_ tbd_<span style='color: blue; font-weight: bold'>234</span> </pre> <br /> 한 마디로, 그냥 234 문자열은 모두 선택이 되는데 "(?!tbd_\w*)" 조건을 주는 것이 의미가 없습니다. 저렇게 보면, look-ahead 조건은 뒤에 오는 것이, look-behind 조건은 앞에 오는 것이 맞는 것 같습니다.<br /> <br /> 이 외에도, "<a target='tab' href='https://elvanov.com/2388'>정규 표현식 Lookahead, Lookbehind 기능 이해하기</a>" 글에 lookaround의 규칙이 "결과가 소모되지 않는다"라는 설명을 하고 있으니, 이에 대해 모르시는 분은 꼭 저 글을 읽어보시고 이참에 눈에 익혀 두시는 것을 권장합니다. ^^<br /> <br /> <hr style='width: 50%' /><br /> <br /> 참고로, C#의 코딩 결과도 regexr.com과 (위의 예제 중 이해할 수 없는 동작들까지 모두) 동일합니다. 그런 걸로 봐서는 뭔가 체계적으로 정규 표현식을 접근하면 저 이상한 규칙들이 자연스럽게 해석될 수 있을 듯한데... 일단 이번엔 필요한 정규 표현식은 얻었으니 여기까지만! ^^<br /> </p><br /> <br /><hr /><span style='color: Maroon'>[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]</span> </div>
첨부파일
스팸 방지용 인증 번호
1918
(왼쪽의 숫자를 입력해야 합니다.)