Microsoft MVP성태의 닷넷 이야기
Math: 52. MathNet을 이용한 간단한 통계 정보 처리 - 분산/표준편차 [링크 복사], [링크+제목 복사],
조회: 22178
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
(연관된 글이 2개 있습니다.)

MathNet을 이용한 간단한 통계 정보 처리 - 분산/표준편차

C# - MathNet.Numerics의 Matrix(행렬) 연산
; https://www.sysnet.pe.kr/2/0/11910

MathNET + OxyPlot을 이용한 간단한 통계 정보 처리 - Histogram
; https://www.sysnet.pe.kr/2/0/11916

이번엔 MathNet의 분산과 표준편차를 위한 메서드를 보겠습니다.

List<double> dblHeights = LoadData("data.txt");

// dblHeights == 32 27 29 34 33라고 가정

Console.WriteLine($"# of data: {dblHeights.Count}"); // 31

Console.WriteLine($"MathNet - Variance: {Statistics.Variance(dblHeights)}"); // 8.5
Console.WriteLine($"MathNet - Standard Deviation: {Statistics.StandardDeviation(dblHeights)}"); // 2.91547594742265

그런데 값이 좀 이상합니다. 위의 분산값은 8.5라고 나오는데, 실제로 계산해 보면 6.8이기 때문입니다. (분산이 틀리니 표준편차 값도 당연히 틀립니다.) 이유는 간단합니다. Variance와 StandardDeviation 메서드는 통계의 "모집단(population)에 대한 분산/표준편차"가 아니라 "표본(sample)에 대한 분산/표준편차"를 출력해 주는 것이고 표본의 경우 Bessel's correction을 고려한 값을 반환하도록 되어 있습니다.

엑셀(Excel)을 해보신 분은 알겠지만 엑셀에서도 다음의 2가지 분산/표준편차 함수가 제공됩니다.

VAR.S       표본에 대한 분산
STDDEV.S    표본에 대한 표준편차

VAR.P       모집단에 대한 분산
STDDEV.P    모집단에 대한 표준편차

* S는 Sample, P는 Population을 의미

C# 코드로 분산을 구현하면 이렇게 작성할 수 있습니다.

public static double Variance(double[] samples, double mean, bool useBesselCorrection)
{
    if (samples.Length <= ((useBesselCorrection == true) ? 1 : 0))
    {
        return double.NaN;
    }

    double sum = 0;

    for (int i = 0; i < samples.Length; i++)
    {
        double diff = samples[i] - mean;
        sum += (diff * diff);
    }

    double variance = sum / ((samples.Length - ((useBesselCorrection == true) ? 1 : 0)));
    return variance;
}

통계학의 기본을 알지 못하면 어찌 보면 말장난 같기도 합니다. 모집단에 대한 분산을 구할 때는 samples.Length로 나누고, 표본에 대한 분산을 구할 때는 samples.Length - 1을 하게 됩니다. 즉, 동일한 데이터를 samples 배열에 넣어 전달해도 그것이 모집단(전체 집합)의 데이터냐, 부분 샘플에 대한 데이터냐에 따라 결과가 달리 나오는 것입니다. (참고: https://blog.naver.com/dalsapcho/20147545698, 개인적으로 이 글에서 "개념 정리"에 나온 그림이 마음에 듭니다. ^^)




그런데 Math.NET의 분산을 구하는 코드가 재미있습니다.

/*
Estimates the unbiased population variance from the provided samples as unsorted array. 
On a dataset of size N will use an N-1 normalizer (Bessel's correction). 
Returns NaN if data has less than two entries or if any entry is NaN. 
*/
public static double Variance(double[] samples)
{
    if (samples.Length <= 1)
    {
        return double.NaN;
    }
    double num = 0.0;
    double num2 = samples[0];
    for (int i = 1; i < samples.Length; i++)
    {
        num2 += samples[i];
        double num4 = ((i + 1) * samples[i]) - num2;
        num += (num4 * num4) / ((i + 1.0) * i);
    }
    return (num / ((double) (samples.Length - 1))); // 표본 분산이므로.
}

제가 만든 C# 분산 코드와 위의 분산을 구하는 코드가 다릅니다. 하지만 (double 연산의 특성으로 소수점 2자리부터 차이가 발생하지만) 결과는 같습니다. 왜 저렇게 어렵게 분산을 구하는 것일까요? 이유가 멋집니다. 제가 작성했던 코드는 2-pass인 반면, Math.NET의 코드는 1-pass입니다. 다시 말해, 제가 작성한 코드는 평균값을 알고 있어야 하는데 그 평균을 구하기 위해 미리 한번 전체 데이터에 대한 루프를 돌아야 하지만, Math.NET의 코드는 평균값을 알지 못해도 분산을 구할 수 있는 것입니다.

물론, 평균값을 이미 구했다면 2-pass 코드가 분산을 더 빠르게 구할 수 있습니다. 사실... 통계값을 구한다면 대부분의 경우 평균은 기본적으로 구할 것이므로 현실적으로 효용성이 있느냐는 별개의 문제로 보입니다. ^^




참고로 Math.NET에서 모집단에 대한 분산/표준편차를 구하려면 Population이 붙은 메서드를 사용하면 됩니다.

Console.WriteLine($"MathNet - Variance: {Statistics.PopulationVariance(dblHeights)}");
Console.WriteLine($"MathNet - Standard Deviation: {Statistics.PopulationStandardDeviation(dblHeights)}");

또한 구현 코드 역시 Bessel's correction의 차이에 따라 "-1" 교정이 없는 버전의 동일한 코드로 제공됩니다.

/*
Evaluates the population variance from the full population provided as unsorted array. 
On a dataset of size N will use an N normalizer and would thus be biased if applied to a subset. 
Returns NaN if data is empty or if any entry is NaN.
*/
public static double PopulationVariance(double[] population)
{
    if (population.Length == 0)
    {
        return double.NaN;
    }
    double num = 0.0;
    double num2 = population[0];
    for (int i = 1; i < population.Length; i++)
    {
        num2 += population[i];
        double num4 = ((i + 1) * population[i]) - num2;
        num += (num4 * num4) / ((i + 1.0) * i);
    }
    return (num / ((double) population.Length));
}

(첨부 파일은 이 글의 예제 코드를 포함합니다.)




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 2/21/2023]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... 136  137  138  139  [140]  141  142  143  144  145  146  147  148  149  150  ...
NoWriterDateCnt.TitleFile(s)
1554정성태12/26/201335321Windows: 78. 마음에 드는 윈도우 8.1 태블릿 - 델 베뉴 8 프로 5830 [4]
1553정성태12/26/201322345개발 환경 구성: 206. JNBridgePro와 한글 인코딩 문제파일 다운로드1
1552정성태12/25/201327528개발 환경 구성: 205. JNBridgePro를 이용해 C#에서 Java메서드 호출 테스트파일 다운로드1
1551정성태12/24/201322678.NET Framework: 398. tech-days 미니 토요세미나 - 3회 C#편 PPT 자료파일 다운로드1
1550정성태12/13/201325064Windows: 77. Windows 8 - 잠시 사용을 안하는 경우 화면 잠김 상태로 빠지는 문제
1549정성태12/13/201328651VC++: 73. IIS - ISAPI 필터 제작하는 방법 [2]
1548정성태12/10/201321333오류 유형: 198. C# - 제네릭 covariance/contravariance 사용할 때 컴파일 오류가 발생한다면?
1547정성태12/10/201330893.NET Framework: 397. C# - OCX 컨트롤에 구현된 메서드에 배열을 in, out으로 전달하는 방법파일 다운로드2
1546정성태11/28/201324763.NET Framework: 396. C# - 프로퍼티로 정의하면 필드보다 느릴까요? - windbg / ollydbg [3]
1545정성태11/28/201328645.NET Framework: 395. C# - 프로퍼티로 정의하면 필드보다 느릴까요? [3]
1544정성태11/27/201325128개발 환경 구성: 204. Visual Studio Online "Monaco" 서비스와 github 연동
1543정성태11/27/201329878오류 유형: 197. error MSB8008: Specified platform toolset (v120) is not installed or invalid. [1]
1542정성태11/27/201335455오류 유형: 196. The procedure entry point InitializeCriticalSectionEx could not be located in the dynamic link library KERNEL32.dll
1541정성태11/22/201336655.NET Framework: 394. async/await 사용 시 hang 문제가 발생하는 경우 [7]파일 다운로드1
1540정성태11/20/201325107개발 환경 구성: 203. Azure - WEB SITES 서비스 소개 [4]
1539정성태11/19/201329107VS.NET IDE: 83. 형상 관리 서버 운영을 대신해 주는 Visual Studio 온라인 서비스
1538정성태11/19/201329981오류 유형: 195. 웹 사이트의 모든 정적 컨텐츠 요청에 대해 "Internal Server Error" 응답
1537정성태11/19/201321625오류 유형: 194. 윈도우 서버 백업으로 인해 Hyper-V VM들의 상태가 모두 "Backing up..." 상태로 오래 지속되는 문제
1536정성태11/19/201326442오류 유형: 193. 윈도우 서버 백업 - Hyper-V 가상 머신이 백업되지 않는 경우
1535정성태11/18/201326549.NET Framework: 393. Internet Explorer 11에서 ASP.NET 컨트롤의 크기가 달라지는 문제 [1]
1534정성태11/13/201326540.NET Framework: 392. .NET 스레드 콜 스택 덤프 (6) - MDbg를 이용한 방법 [2]파일 다운로드1
1533정성태11/12/201333755기타: 39. Internet Explorer 11에서 유튜브 동영상의 1080p 옵션이 보이지 않는 경우 [5]
1532정성태11/5/201334668Phone: 8. 안드로이드용 Xamarin 개발 시 겪을 만한 시행 착오 정리 [6]
1531정성태11/5/201326066VS.NET IDE: 82. Visual Studio에서 Attach 메서드를 이용해 디버깅을 시작한 경우 Breakpoint가 안 잡힌다면?
1530정성태11/5/201327445기타: 38. 오픈소스로 풀린 하드 디스크 관리 도구 - WindowSMART
1529정성태11/5/201323338오류 유형: 192. SQL 서버 - The transaction log for database '...' is full due to 'LOG_BACKUP'.
... 136  137  138  139  [140]  141  142  143  144  145  146  147  148  149  150  ...