Microsoft MVP성태의 닷넷 이야기
닷넷: 2349. C# 14 - (5) 문자열 리터럴을 utf-8 인코딩으로 저장 [링크 복사], [링크+제목 복사],
조회: 890
글쓴 사람
정성태 (seongtaejeong at gmail.com)
홈페이지
첨부 파일

(시리즈 글이 5개 있습니다.)
닷넷: 2342. C# 14 - (1) (예약)
; https://www.sysnet.pe.kr/2/0/13970

닷넷: 2343. C# 14 - (2) 속성 구문에서 문맥 키워드로 추가되는 field 예약어
; https://www.sysnet.pe.kr/2/0/13971

닷넷: 2346. C# 14 - (3) Span 타입과 배열 간의 암시적 형변환
; https://www.sysnet.pe.kr/2/0/13974

닷넷: 2347. C# 14 - (4) 형식 인자가 없는 제네릭 타입의 nameof 지원
; https://www.sysnet.pe.kr/2/0/13975

닷넷: 2349. C# 14 - (5) 문자열 리터럴을 utf-8 인코딩으로 저장
; https://www.sysnet.pe.kr/2/0/13977




C# 14 - (5) 문자열 리터럴을 utf-8 인코딩으로 저장

이번엔 C# 자체의 언어 수준에 대한 변화는 아니고 C# 컴파일러 측의 변경입니다.

String literals in data section
; https://github.com/dotnet/roslyn/blob/main/docs/features/string-literals-data-section.md#eligible-string-literals

기본적으로 C# 컴파일러는 문자열 리터럴을 UTF-16 인코딩으로 저장하고, C# 11부터 추가된 UTF-8 문자열 리터럴의 경우에는 UTF-8 인코딩으로 저장합니다.

그런데, C# 14부터는 (u8 접미사를 붙이지 않은) 일반적인 문자열 리터럴도 UTF-8 인코딩으로 바이너리에 저장하는 옵션이 추가됐습니다. 이를 위해 C# 프로젝트에서는 다음과 같이 설정을 추가하면 되는데요,

<Project Sdk="Microsoft.NET.Sdk">

    <PropertyGroup>
        <OutputType>Exe</OutputType>
        <TargetFramework>net8.0</TargetFramework>
        <ImplicitUsings>enable</ImplicitUsings>
        <Nullable>enable</Nullable>
        <LangVersion>preview</LangVersion>
        <!-- 아래는 0을 지정, 만약 숫자를 지정하지 않으면 기본값 100 -->
        <Features>$(Features);experimental-data-section-string-literals=0</Features>
    </PropertyGroup>

</Project>

그럼, (위에서는 0으로 설정했으므로, 그 이상의 길이를 갖는) 모든 문자열 리터럴을 UTF-8 인코딩으로 저장합니다. 실제로 눈으로 확인해 볼까요? ^^ 이를 위해 간단한 예제를 하나 만들고,

// 아래의 코드로 빌드한 DLL로 테스트
using System;

namespace ConsoleApp1;

internal class Program
{
    static void Main(string[] args)
    {
        string s = "Hello, World!";
        Console.WriteLine(s);
    }
}

일단 csproj 파일에 Features 설정 없이 빌드해 ConsoleApp1.dll 파일을 PE Viewer로 열어 보면,

cs14_string_literals_utf8_0.png

보는 바와 같이 닷넷 메타데이터 영역에 "#US", 즉 "UserString" 섹션에 문자열이 UTF-16 인코딩으로 저장돼 있습니다. 이제 csproj 파일에 Features 옵션을 추가하고 다시 빌드하면,

cs14_string_literals_utf8_1.png

#US 섹션에는 "Hello, World!" 문자열이 없어졌고, 대신 (닷넷 메타데이터가 아닌) PE 포맷의 하나인 ".text" 섹션에 "Hello, World!" 문자열이 UTF-8 인코딩으로 저장된 것을 확인할 수 있습니다.

cs14_string_literals_utf8_2.png




이 기능으로 어떤 성능 향상을 기대할 수 있는 것은 아닙니다. 왜냐하면, 리터럴 데이터만 디스크에 UTF-8로 저장하는 것일 뿐, 어차피 실행 시에는 UTF-16 인코딩으로 변환돼 System.String 타입으로 다뤄져야 하기 때문입니다. 이에 대한 사실을 "Hello, World!" 문자열을 다루기 위해 C# 컴파일러가 생성한 자동 코드를 보면 알 수 있습니다.

using System.Runtime.CompilerServices;
using System.Runtime.InteropServices;
using System.Text;

[CompilerGenerated]
internal sealed class \u003CPrivateImplementationDetails\u003E
{
  internal static readonly \u003CPrivateImplementationDetails\u003E.__StaticArrayInitTypeSize\u003D13 DFFD6021BB2BD5B0AF676290809EC3A53191DD81C7F70A4B28688A362182986F;

  private static unsafe string BytesToString(byte* bytes, int length)
  {
    return Encoding.UTF8.GetString(bytes, length);
  }

  [StructLayout(LayoutKind.Explicit, Size = 13, Pack = 1)]
  internal struct __StaticArrayInitTypeSize\u003D13
  {
  }

  internal sealed class \u003CS\u003E531DF2844447DD5077DB03842CD75395
  {
    internal static readonly string s;

    static unsafe \u003CS\u003E531DF2844447DD5077DB03842CD75395()
    {
      \u003CPrivateImplementationDetails\u003E.\u003CS\u003E531DF2844447DD5077DB03842CD75395.s = \u003CPrivateImplementationDetails\u003E.BytesToString((byte*) &\u003CPrivateImplementationDetails\u003E.DFFD6021BB2BD5B0AF676290809EC3A53191DD81C7F70A4B28688A362182986F, 13);
    }
  }
}

저렇게 정적 생성자 단계에서 "Hello, World!" 문자열을 UTF-16 인코딩으로 변환해 System.String 타입으로 들고 있게 한 후, 원래의 코드에서 다음과 같이 사용하도록 바뀝니다.

private static void Main(string[] args)
{
    Console.WriteLine(\u003CPrivateImplementationDetails\u003E.\u003CS\u003E531DF2844447DD5077DB03842CD75395.s);
}

그렇다면, 왜 굳이 이런 기능을 추가했을까요? 문서를 보면, 그동안 C# 컴파일러는 문자열 리터럴을 (위의 PE Viewer에서 "#US"로 지정된) UserString 힙에 보관하는데, 그 크기가 2의 24승(16MB)으로 제한돼 있다고 합니다. 의외로 꽤 작죠? 그래서 이 한계를 넘게 문자열 리터럴을 사용하면 컴파일 시점에 이런 오류가 발생한다고 합니다.

error CS8103: Combined length of user strings used by the program exceeds allowed limit. Try to decrease use of string literals.


아마도 저 제약에 걸린 프로그램을 만드는 개발자들이 은근 있었나 봅니다. ^^ (그랬다면, 그들은 그동안 순전히 문자열 리터럴을 나누기 위해 별도의 DLL을 만들어서 사용해야만 했을 것입니다.)

하지만 C# 14부터는, "experimental-data-section-string-literals" 기능을 통해 빌드하는 경우 #US 섹션이 아닌, C/C++처럼 문자열을 PE 파일의 readonly 섹션에 저장해 두기 때문에 문자열 리터럴의 크기에 대한 제약이 없어집니다. 좋은 소식이죠?!!! ^^

정리하면, CS8103 오류를 겪지 않는 한 굳이 설정할 필요가 없는 옵션입니다.




참고로 (네트워크 통신 등의 속도를 높이기 위해), UTF-16으로의 변환을 하고 싶지 않다면 u8 접미사를 이용한 UTF-8 인코딩을 사용하면 됩니다.

C# 11 - UTF-8 문자열 리터럴
; https://www.sysnet.pe.kr/2/0/13096

물론, 저 u8 문자열 리터럴도 "#US" 섹션이 아닌 PE 파일의 .text 섹션에 저장되므로 16MB의 제약은 없습니다.





[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]







[최초 등록일: ]
[최종 수정일: 7/28/2025]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... 136  137  138  139  140  141  142  143  144  145  146  147  [148]  149  150  ...
NoWriterDateCnt.TitleFile(s)
1414정성태2/21/201335286개발 환경 구성: 182. JMeter로 XML 웹 서비스 호출에 대한 부하 테스트 방법파일 다운로드2
1413정성태2/19/201335064VC++: 66. Chromium 컴파일하는 방법 - 두 번째 이야기 [3]
1412정성태2/6/201336930VC++: 65. Python 소스코드를 Visual C++로 빌드하는 방법 [3]
1411정성태1/31/201352263개발 환경 구성: 181. 무료 데이터베이스 서버 성능 비교(SQL Server Express, IBM DB2 Express, MySQL, Sybase, PostgreSQL, Oracle XE) [9]
1410정성태1/31/201334177.NET Framework: 362. C# - 닷넷 응용 프로그램에서 Sybase DB 사용 [1]파일 다운로드1
1409정성태1/30/201338003.NET Framework: 361. C# - 공유기 관리 웹 페이지 인증 [4]파일 다운로드1
1408정성태1/29/201332932.NET Framework: 360. C# - 닷넷 응용 프로그램에서 DB2 Express-C 데이터베이스 사용 (2) [1]파일 다운로드1
1407정성태1/29/201331185.NET Framework: 359. C# - 닷넷 응용 프로그램에서 DB2 Express-C 데이터베이스 사용 (1)
1406정성태1/22/201325747개발 환경 구성: 180. Windows Server 2012 RC 버전을 RTM으로 업그레이드하는 방법
1405정성태1/16/201347260.NET Framework: 358. C# - 닷넷 응용 프로그램에서 MySQL(MySqlConnector) 사용 [7]파일 다운로드1
1404정성태1/15/201331804개발 환경 구성: 179. Hyper-V VM 복사는 robocopy로. [2]
1403정성태1/14/201333933.NET Framework: 357. .NET 4.5의 2GB 힙 한계 극복
1402정성태1/14/201335414오류 유형: 166. SmtpClient.Send 오류 - net_io_connectionclosed
1401정성태1/11/201333145.NET Framework: 356. (공개키를 담은) 자바의 key 파일을 닷넷의 RSACryptoServiceProvider에서 사용하는 방법 [2]파일 다운로드1
1400정성태1/10/201332223Windows: 69. 작업표시줄의 터치 키보드(Touch Keyboard) 없애는 방법 [3]
1399정성태1/9/201327705.NET Framework: 355. 닷넷 환경이 왜 C/C++보다 느릴까요? [8]
1398정성태1/8/201327681오류 유형: 165. 새로 설치한 Visual Studio 2010의 Team Explorer 실행시 비정상 종료가 된다면?
1397정성태1/3/201331531Windows: 68. 윈도우 설치 ISO 이미지를 USB 하드에 적용하는 방법 [2]
1396정성태12/27/201232925사물인터넷: 2. 넷두이노 - 4.2.0 펌웨어 업데이트 방법 [1]파일 다운로드1
1395정성태12/26/201223240.NET Framework: 354. x64 - AspCompat과 STA COM 개체가 성능에 미치는 영향
1394정성태12/25/201224408.NET Framework: 353. x86 - AspCompat과 STA COM 개체가 성능에 미치는 영향
1393정성태12/25/201225651.NET Framework: 352. x64에서 필수로 지정하도록 바뀐 STAThread 특성 [2]
1392정성태12/21/201235713사물인터넷: 1. .NET Micro Framework - 넷두이노 플러스 [7]
1391정성태12/21/201228221.NET Framework: 351. JavaScriptSerializer, DataContractJsonSerializer, Json.NET [3]파일 다운로드1
1390정성태12/20/201226683.NET Framework: 350. String 데이터를 Stream으로 변환하는 방법 [2]
1389정성태12/12/201224485.NET Framework: 349. .NET Thread 인스턴스로부터 COM Apartment 유형 확인하는 방법파일 다운로드1
... 136  137  138  139  140  141  142  143  144  145  146  147  [148]  149  150  ...