Microsoft MVP성태의 닷넷 이야기
Math: 52. MathNet을 이용한 간단한 통계 정보 처리 - 분산/표준편차 [링크 복사], [링크+제목 복사],
조회: 23471
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
(연관된 글이 2개 있습니다.)

MathNet을 이용한 간단한 통계 정보 처리 - 분산/표준편차

C# - MathNet.Numerics의 Matrix(행렬) 연산
; https://www.sysnet.pe.kr/2/0/11910

MathNET + OxyPlot을 이용한 간단한 통계 정보 처리 - Histogram
; https://www.sysnet.pe.kr/2/0/11916

이번엔 MathNet의 분산과 표준편차를 위한 메서드를 보겠습니다.

List<double> dblHeights = LoadData("data.txt");

// dblHeights == 32 27 29 34 33라고 가정

Console.WriteLine($"# of data: {dblHeights.Count}"); // 31

Console.WriteLine($"MathNet - Variance: {Statistics.Variance(dblHeights)}"); // 8.5
Console.WriteLine($"MathNet - Standard Deviation: {Statistics.StandardDeviation(dblHeights)}"); // 2.91547594742265

그런데 값이 좀 이상합니다. 위의 분산값은 8.5라고 나오는데, 실제로 계산해 보면 6.8이기 때문입니다. (분산이 틀리니 표준편차 값도 당연히 틀립니다.) 이유는 간단합니다. Variance와 StandardDeviation 메서드는 통계의 "모집단(population)에 대한 분산/표준편차"가 아니라 "표본(sample)에 대한 분산/표준편차"를 출력해 주는 것이고 표본의 경우 Bessel's correction을 고려한 값을 반환하도록 되어 있습니다.

엑셀(Excel)을 해보신 분은 알겠지만 엑셀에서도 다음의 2가지 분산/표준편차 함수가 제공됩니다.

VAR.S       표본에 대한 분산
STDDEV.S    표본에 대한 표준편차

VAR.P       모집단에 대한 분산
STDDEV.P    모집단에 대한 표준편차

* S는 Sample, P는 Population을 의미

C# 코드로 분산을 구현하면 이렇게 작성할 수 있습니다.

public static double Variance(double[] samples, double mean, bool useBesselCorrection)
{
    if (samples.Length <= ((useBesselCorrection == true) ? 1 : 0))
    {
        return double.NaN;
    }

    double sum = 0;

    for (int i = 0; i < samples.Length; i++)
    {
        double diff = samples[i] - mean;
        sum += (diff * diff);
    }

    double variance = sum / ((samples.Length - ((useBesselCorrection == true) ? 1 : 0)));
    return variance;
}

통계학의 기본을 알지 못하면 어찌 보면 말장난 같기도 합니다. 모집단에 대한 분산을 구할 때는 samples.Length로 나누고, 표본에 대한 분산을 구할 때는 samples.Length - 1을 하게 됩니다. 즉, 동일한 데이터를 samples 배열에 넣어 전달해도 그것이 모집단(전체 집합)의 데이터냐, 부분 샘플에 대한 데이터냐에 따라 결과가 달리 나오는 것입니다. (참고: https://blog.naver.com/dalsapcho/20147545698, 개인적으로 이 글에서 "개념 정리"에 나온 그림이 마음에 듭니다. ^^)




그런데 Math.NET의 분산을 구하는 코드가 재미있습니다.

/*
Estimates the unbiased population variance from the provided samples as unsorted array. 
On a dataset of size N will use an N-1 normalizer (Bessel's correction). 
Returns NaN if data has less than two entries or if any entry is NaN. 
*/
public static double Variance(double[] samples)
{
    if (samples.Length <= 1)
    {
        return double.NaN;
    }
    double num = 0.0;
    double num2 = samples[0];
    for (int i = 1; i < samples.Length; i++)
    {
        num2 += samples[i];
        double num4 = ((i + 1) * samples[i]) - num2;
        num += (num4 * num4) / ((i + 1.0) * i);
    }
    return (num / ((double) (samples.Length - 1))); // 표본 분산이므로.
}

제가 만든 C# 분산 코드와 위의 분산을 구하는 코드가 다릅니다. 하지만 (double 연산의 특성으로 소수점 2자리부터 차이가 발생하지만) 결과는 같습니다. 왜 저렇게 어렵게 분산을 구하는 것일까요? 이유가 멋집니다. 제가 작성했던 코드는 2-pass인 반면, Math.NET의 코드는 1-pass입니다. 다시 말해, 제가 작성한 코드는 평균값을 알고 있어야 하는데 그 평균을 구하기 위해 미리 한번 전체 데이터에 대한 루프를 돌아야 하지만, Math.NET의 코드는 평균값을 알지 못해도 분산을 구할 수 있는 것입니다.

물론, 평균값을 이미 구했다면 2-pass 코드가 분산을 더 빠르게 구할 수 있습니다. 사실... 통계값을 구한다면 대부분의 경우 평균은 기본적으로 구할 것이므로 현실적으로 효용성이 있느냐는 별개의 문제로 보입니다. ^^




참고로 Math.NET에서 모집단에 대한 분산/표준편차를 구하려면 Population이 붙은 메서드를 사용하면 됩니다.

Console.WriteLine($"MathNet - Variance: {Statistics.PopulationVariance(dblHeights)}");
Console.WriteLine($"MathNet - Standard Deviation: {Statistics.PopulationStandardDeviation(dblHeights)}");

또한 구현 코드 역시 Bessel's correction의 차이에 따라 "-1" 교정이 없는 버전의 동일한 코드로 제공됩니다.

/*
Evaluates the population variance from the full population provided as unsorted array. 
On a dataset of size N will use an N normalizer and would thus be biased if applied to a subset. 
Returns NaN if data is empty or if any entry is NaN.
*/
public static double PopulationVariance(double[] population)
{
    if (population.Length == 0)
    {
        return double.NaN;
    }
    double num = 0.0;
    double num2 = population[0];
    for (int i = 1; i < population.Length; i++)
    {
        num2 += population[i];
        double num4 = ((i + 1) * population[i]) - num2;
        num += (num4 * num4) / ((i + 1.0) * i);
    }
    return (num / ((double) population.Length));
}

(첨부 파일은 이 글의 예제 코드를 포함합니다.)




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 2/21/2023]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... 106  107  108  109  [110]  111  112  113  114  115  116  117  118  119  120  ...
NoWriterDateCnt.TitleFile(s)
11209정성태5/25/201770255Windows: 143. Windows 10의 Recovery 파티션을 삭제 및 새로 생성하는 방법 [16]
11208정성태5/25/201729008오류 유형: 390. diskpart의 set id 명령어에서 "The specified type is not in the correct format." 오류 발생
11207정성태5/24/201729888Windows: 142. Windows 10의 복구 콘솔로 부팅하는 방법
11206정성태5/24/201723048오류 유형: 389. DISM.exe - The specified image in the specified wim is already mounted for read/write access.
11205정성태5/24/201722815.NET Framework: 658. C#의 tail call 구현은? [1]
11204정성태5/22/201732339개발 환경 구성: 316. 간단하게 살펴보는 Docker for Windows [7]
11203정성태5/19/201719657오류 유형: 388. docker - Host does not exist: "default"
11202정성태5/19/201720751오류 유형: 387. WPF - There is no registered CultureInfo with the IetfLanguageTag 'ug'.
11201정성태5/16/201724290오류 유형: 386. WPF - .NET 3.5 이하에서 TextBox에 한글 입력 시 TextChanged 이벤트의 비정상 종료 문제 [1]파일 다운로드1
11200정성태5/16/201721065오류 유형: 385. WPF - 폰트가 없어 System.IO.FileNotFoundException 예외가 발생하는 경우
11199정성태5/16/201722263.NET Framework: 657. CultureInfo.GetCultures가 반환하는 값
11198정성태5/10/201724327.NET Framework: 656. Windows Forms의 오류(Exception) 처리 방법에 대한 차이점 설명
11197정성태5/8/201720530개발 환경 구성: 315. VHD 파일의 최소 크기파일 다운로드1
11196정성태5/4/201721943오류 유형: 384. Msvm_ImageManagementService WMI 객체를 사용할 때 오류 상황 정리 [1]
11195정성태5/3/201722723.NET Framework: 655. .NET Framework 4.7 릴리스
11194정성태5/3/201724236오류 유형: 383. net use 명령어로 네트워크 드라이브 연결 시 "System error 67 has occurred." 오류 발생
11193정성태5/3/201722189Windows: 141. 설치된 Windows로부터 설치 이미지를 만드는 방법
11192정성태5/2/201723576Windows: 140. unattended.xml/autounattend.xml 파일을 마련하는 방법
11191정성태5/2/201724400Windows: 139. Dell Venue 8 Pro 태블릿에 USB를 이용한 윈도우 운영체제 설치 방법
11190정성태5/2/201729817Windows: 138. Windows 운영체제의 ISO 설치 파일에 미리 Device driver를 준비하는 방법
11189정성태5/2/201721173Windows: 137. Windows 7 USB/DVD DOWNLOAD TOOL로 98%에서 실패하는 경우
11188정성태4/27/201723945VC++: 118. Win32 HANDLE 자료형의 이모저모 [2]
11187정성태4/26/201724870개발 환경 구성: 314. C# - PowerPoint 확장 Add-in 만드는 방법 [1]파일 다운로드1
11186정성태4/24/201722806VS.NET IDE: 117. Visual Studio 확장(VSIX)을 이용해 사용자 매크로를 추가하는 방법 [1]파일 다운로드1
11185정성태4/22/201720414VS.NET IDE: 116. Visual Studio 확장(VSIX)을 이용해 사용자 메뉴 추가하는 방법 (2) - 동적 메뉴 구성파일 다운로드1
11184정성태4/21/201722085VS.NET IDE: 115. Visual Studio 확장(VSIX)을 이용해 사용자 메뉴 추가하는 방법파일 다운로드1
... 106  107  108  109  [110]  111  112  113  114  115  116  117  118  119  120  ...