Microsoft MVP성태의 닷넷 이야기
C/C++: 178. C++ - 파일에 대한 Text 모드의 "translated" 동작 [링크 복사], [링크+제목 복사],
조회: 4565
글쓴 사람
정성태 (seongtaejeong at gmail.com)
홈페이지
첨부 파일
(연관된 글이 1개 있습니다.)
(시리즈 글이 3개 있습니다.)
C/C++: 178. C++ - 파일에 대한 Text 모드의 "translated" 동작
; https://www.sysnet.pe.kr/2/0/13766

C/C++: 179. C++ - _O_WTEXT, _O_U16TEXT, _O_U8TEXT의 Unicode stream 모드
; https://www.sysnet.pe.kr/2/0/13768

C/C++: 180. C++ - 고수준 FILE I/O 함수에서의 Unicode stream 모드(_O_WTEXT, _O_U16TEXT, _O_U8TEXT)
; https://www.sysnet.pe.kr/2/0/13776




C++ - 파일에 대한 Text 모드의 "translated" 동작

파일을 위한 Translation 모드로는 Visual C++의 경우 _O_BINARY(_O_RAW), _O_TEXT, _O_WTEXT, _O_U16TEXT, _O_U8TEXT를 지원합니다.

Translation mode constants
; https://learn.microsoft.com/en-us/cpp/c-runtime-library/translation-mode-constants

이 중에서 _O_BINARY를 제외한 모드들은 모두 _O_TEXT 모드의 기본 변환을 지원한다고 하는데요, 이에 대해 문서에는 다음과 같은 특징을 설명합니다.

Opens file in ANSI text (translated) mode. Carriage return-line feed (CR-LF) combinations are translated into a single line feed (LF) on input. Line feed characters are translated into CR-LF combinations on output. Also, CTRL+Z is interpreted as an end-of-file character on input. In files opened for reading, and for reading and writing, fopen checks for CTRL+Z at the end of the file and removes it, if possible. It's removed because using the fseek and ftell functions to move within a file ending with CTRL+Z may cause fseek to behave improperly near the end of the file.


하나씩 직접 테스트를 해볼까요? ^^

우선 CTRL+Z 문자가 입력 시에 제거되는 특징을 살펴보겠습니다. 명령행 창을 열어 다음과 같이 입력해 보면,

// 아래의 ^Z는 키보드에서 CTRL+Z를 눌러 입력할 수 있습니다.

c:\temp> copy con test.txt
test^Z
        1 file(s) copied.

c:\temp>

위의 명령어는 "con"으로 대표되는 입력 장치로부터 사용자가 타이핑한 글자를 받아 출력을 test.txt 파일로 보냅니다. "con"은 "표준 입력(Standard Input)" 장치의 별명인데, stdin은 _O_TEXT 모드로 열리는 대표적인 장치입니다.

The stdin, stdout, and stderr streams always open in text mode by default;

따라서 위의 입력에서는 "test" 문자열과 "CTRL+Z" 문자열(ASCII 26, 0x1A)을 입력했으므로 원칙상으로는 5개의 문자가 파일에 저장돼야 합니다.

하지만, test.txt 파일을 덤프해 보면,

c:\temp> powershell Format-Hex -Path test.txt

           Path: C:\temp\test.txt

           00 01 02 03 04 05 06 07 08 09 0A 0B 0C 0D 0E 0F

00000000   74 65 73 74                                     test

translated 모드의 동작 특성으로 인해 위와 같이 4개의 문자만 있을 뿐 마지막에 0x1A 값이 없습니다. 즉, _O_TEXT 모드로 열린 파일로부터 입력된 CTRL+Z는 제거되는 식으로 처리되기 때문에 출력에 나타나지 않습니다.

stdin 말고, 파일로도 테스트를 해볼까요?

위에 출력된 test.txt 파일을 hexa editor 등을 이용해 's' 글자에 해당하는 0x73 값을 0x1A로 바꿉니다.

00000000   74 65 1A 74       te.t

이후, 저 텍스트 파일을 읽어내는 코드를 만들어,

#include <iostream>

int main()
{
    FILE* fi = nullptr;
    
    fopen_s(&fi, "test_ctrlz.txt", "rt"); // read + text

    char buffer[100];
    while (true)
    {
        int ch = fgetc(fi);
        if (ch == -1) // 0x1A를 읽는 시점에 ch == -1
        {
            break;
        }

        printf("0x%02x,", ch);
    }
}

실행해 보면, 0x1A 문자, 즉 CTRL+Z에 해당하는 문자가 읽히면 ch 값이 0x1A가 아니라 -1이 나옵니다. 왜냐하면, _O_TEXT 모드로 열린 파일에서는 그렇게 CTRL+Z는 제거되는 식으로 처리되기 때문입니다.

반면, _O_BINARY 모드로 열린 파일이라면,

fopen_s(&fi, "test_file.txt", "rb"); // read + binary

이번에는 0x1A를 그 값 그대로 읽어들입니다.




그다음, 출력 시 LF(Line Feed) 문자를 CR-LF(Carriage Return-Line Feed)로 변환하는 것을 확인해 보겠습니다. 문서에 따라 _O_TEXT 모드에서는,

  • 입력 시 CR-LF를 LF로 변환
  • 출력 시 LF를 CR-LF로 변환

이런 변환을 수행한다고 돼 있는데요, 역시 이를 테스트하기 위해 test.txt 파일에 CR, LF에 해당하는 "\r\n" 문자열을 추가해,

00000000   74 65 73 74 0D 0A 74     test..t

위에서 만든 코드로 파일을 읽어보면 다음과 같은 출력을 얻게 됩니다.

0x74,0x65,0x73,0x74,0x0a,0x74,

보는 바와 같이 0D(CR), 0A(LF)가 나오지 않고 0A(LF) 하나만 나왔습니다. 그럼, 반대로 출력 측으로 LF 하나만 보내볼까요? ^^

fopen_s(&fi, "test_out.txt", "wt");
char text[] = "Hello\x0aWorld!";
fprintf(fi, text);
fclose(fi);

'\x0a' 대신 우리가 흔히 알고 있는 '\n'을 써도 상관없습니다. 이걸 실행해 보면, 0x0A 문자 하나의 출력이 다음과 같이 0D 0A로 변환돼 출력되는 것을 확인할 수 있습니다.

00000000   48 65 6C 6C 6F 0D 0A 20 57 6F 72 6C 64 21        Hello.. World!




마지막으로 한 가지 더 테스트할 것은, CTRL+Z 문자(0x1A)가 파일의 끝에 있는 경우,

00000000   74 65 73 74 1A     test.

fopen은 파일을 "a+" / "r+" 모드로 여는 경우, 마지막의 0x1A 문자를 제거한다는 사실입니다. 그래서 다음의 코드는,

{
    FILE* fi = nullptr;

    fopen_s(&fi, "test_ctrlz_end.txt", "a+"); // 또는 "r+"

    int pos = fseek(fi, 0, SEEK_END);
    long size = ftell(fi);

    printf("test_ctrlz_end.txt size: %d (a+)\n", size); // (5가 아닌) 4 출력
    fclose(fi);
}

size 값이 4가 나옵니다. 여기서 한 가지 유의해야 할 점이 있는데요, fopen 함수는 마지막의 0x1A 문자를 제거하는 것뿐만 아니라 그 순간 "저장"까지 해버린다는 점입니다. 물론, text 모드가 아닌 바이너리로 여는 경우, 가령 "a+b" 모드로 열면 0x1A 문자가 제거되지 않습니다.





[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 10/27/2024]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... [31]  32  33  34  35  36  37  38  39  40  41  42  43  44  45  ...
NoWriterDateCnt.TitleFile(s)
13162정성태11/15/202215732.NET Framework: 2069. .NET 7 - AOT(ahead-of-time) 컴파일 [1]
13161정성태11/14/202214408.NET Framework: 2068. C# - PublishSingleFile로 배포한 이미지의 역어셈블 가능 여부 (난독화 필요성) [4]
13160정성태11/11/202214372.NET Framework: 2067. C# - PublishSingleFile 적용 시 native/managed 모듈 통합 옵션
13159정성태11/10/202217676.NET Framework: 2066. C# - PublishSingleFile과 관련된 옵션 [3]
13158정성태11/9/202213372오류 유형: 826. Workload definition 'wasm-tools' in manifest 'microsoft.net.workload.mono.toolchain' [...] conflicts with manifest 'microsoft.net.workload.mono.toolchain.net7'
13157정성태11/8/202214393.NET Framework: 2065. C# - Mutex의 비동기 버전파일 다운로드1
13156정성태11/7/202215987.NET Framework: 2064. C# - Mutex와 Semaphore/SemaphoreSlim 차이점파일 다운로드1
13155정성태11/4/202214236디버깅 기술: 183. TCP 동시 접속 (연결이 아닌) 시도를 1개로 제한한 서버
13154정성태11/3/202214720.NET Framework: 2063. .NET 5+부터 지원되는 GC.GetGCMemoryInfo파일 다운로드1
13153정성태11/2/202216035.NET Framework: 2062. C# - 코드로 재현하는 소켓 상태(SYN_SENT, SYN_RECV)
13152정성태11/1/202214946.NET Framework: 2061. ASP.NET Core - DI로 추가한 클래스의 초기화 방법 [1]
13151정성태10/31/202214396C/C++: 161. Windows 11 환경에서 raw socket 테스트하는 방법파일 다운로드1
13150정성태10/30/202213282C/C++: 160. Visual Studio 2022로 빌드한 C++ 프로그램을 위한 다른 PC에서 실행하는 방법
13149정성태10/27/202213851오류 유형: 825. C# - CLR ETW 이벤트 수신이 GCHeapStats_V1/V2에 대해 안 되는 문제파일 다운로드1
13148정성태10/26/202213805오류 유형: 824. msbuild 에러 - error NETSDK1005: Assets file '...\project.assets.json' doesn't have a target for 'net5.0'. Ensure that restore has run and that you have included 'net5.0' in the TargetFramew
13147정성태10/25/202213068오류 유형: 823. Visual Studio 2022 - Unable to attach to CoreCLR. The debugger's protocol is incompatible with the debuggee.
13146정성태10/24/202214367.NET Framework: 2060. C# - Java의 Xmx와 유사한 힙 메모리 최댓값 제어 옵션 HeapHardLimit
13145정성태10/21/202214998오류 유형: 822. db2 - Password validation for user db2inst1 failed with rc = -2146500508
13144정성태10/20/202214693.NET Framework: 2059. ClrMD를 이용해 윈도우 환경의 메모리 덤프로부터 닷넷 모듈을 추출하는 방법파일 다운로드1
13143정성태10/19/202215633오류 유형: 821. windbg/sos - Error code - 0x000021BE
13142정성태10/18/202220431도서: 시작하세요! C# 12 프로그래밍
13141정성태10/17/202216159.NET Framework: 2058. [in,out] 배열을 C#에서 C/C++로 넘기는 방법 - 세 번째 이야기파일 다운로드1
13140정성태10/11/202215561C/C++: 159. C/C++ - 리눅스 환경에서 u16string 문자열을 출력하는 방법 [2]
13139정성태10/9/202213657.NET Framework: 2057. 리눅스 환경의 .NET Core 3/5+ 메모리 덤프로부터 모든 닷넷 모듈을 추출하는 방법파일 다운로드1
13138정성태10/8/202216262.NET Framework: 2056. C# - await 비동기 호출을 기대한 메서드가 동기로 호출되었을 때의 부작용 [1]
13137정성태10/8/202214185.NET Framework: 2055. 리눅스 환경의 .NET Core 3/5+ 메모리 덤프로부터 닷넷 모듈을 추출하는 방법
... [31]  32  33  34  35  36  37  38  39  40  41  42  43  44  45  ...