Microsoft MVP성태의 닷넷 이야기
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
(연관된 글이 1개 있습니다.)

ML.NET Model Builder - 회귀(Regression), 다중 분류(Multi-class classification) 예제

지난번에 설명한,

Visual Studio - ML.NET Model Builder 소개
; https://www.sysnet.pe.kr/2/0/11894

예제는 간단한 2진 분류였는데요, 지난 튜토리얼의 마지막 단계까지 가면,

ML.NET Tutorial - Get started in 10 minutes
; https://dotnet.microsoft.com/learn/machinelearning-ai/ml-dotnet-get-started-tutorial/next

이제 또 다른 시나리오를 실습해 보라면서 "Price prediction dataset" 예제 파일을 링크하고 있습니다.

Price prediction dataset
; https://raw.githubusercontent.com/dotnet/machinelearning-samples/master/samples/csharp/getting-started/Regression_TaxiFarePrediction/TaxiFarePrediction/Data/taxi-fare-train.csv

혹시 당황하셨다면 ^^ 완벽한 예제 코드로 정리된 다음의 문서를 보면 됩니다.

dotnet/machinelearning-samples
; https://github.com/dotnet/machinelearning-samples/tree/master/samples/csharp/getting-started/Regression_TaxiFarePrediction




그러니까 결국 문제는 Model Builder를 사용할 때 어떤 종류의 기계학습에 대한 시나리오가 맞는지 선택하는 것입니다.

  1. 회귀
  2. 분류 - {2진 분류, 다중 분류}

일단, 2진 분류는 결과가 Yes/No로 나온다는 점에서 기준이 매우 간단합니다. 그리고 회귀와 다중 분류의 경우는 결과가 학습 데이터의 "Label"로 제한된 것이라면 다중 분류, 그렇지 않고 연속 공간에서 나오는 것이라면 회귀라고 간단하게 정리할 수 있습니다.

따라서, 이번 주제인 "택시 요금 예측(Taxi Fare Prediction)"은 결괏값이 연속 공간이므로 회귀에 해당합니다. 그럼 Model Builder를 간단하게 사용할 수 있겠죠. ^^

1. Scenario
    Price Prediction

2. Data
    Input: File
    Select a file: taxi-fare-train.csv
    Column to Predict (Label): fare_amount

3. Train
    Time to train (seconds): 10

MLModel.zip 파일이 생성되었으면 이전 글과 동일하게 다음의 작업을 추가하고,

1) Install-Package Microsoft.ML
   Install-Package Microsoft.ML.FastTree
2) MLModel.zip 추가 -  "Copy to Output Directory" - "Copy if newer"
3) ModelInput.cs, ModelOutput.cs 추가

예측 코드를 작성하면 됩니다.

using System;
using Microsoft.ML;
using ConsoleApp1ML.Model.DataModels;

class Program
{
    static void Main(string[] args)
    {
        MLContext mlContext = new MLContext();

        ITransformer mlModel = mlContext.Model.Load("MLModel.zip", out DataViewSchema inputSchema);
        var predEngine = mlContext.Model.CreatePredictionEngine<ModelInput, ModelOutput>(mlModel);

        // Create sample data to do a single prediction with it 
        ModelInput sampleData = new ModelInput
        {
            Vendor_id = "VTS",
            Rate_code = 1.0f,
            Passenger_count = 1,
            Trip_time_in_secs = 1140,
            Trip_distance = 3.75f,
            Payment_type = "CRD",
        };

        // Try a single prediction
        ModelOutput result = predEngine.Predict(sampleData);

        Console.WriteLine($"Single Prediction --> Predicted value: {result.Score}");
    }
}

/* 출력 결과
Single Prediction --> Predicted value: 15.95807
*/




이렇게 해서 "2진 분류"와 "회귀"에 대한 예제를 살펴봤는데요. "다중 분류"도 마저 살펴보겠습니다. 다중 분류의 가장 유명한 사례가 바로 붓꽃 판정입니다.

Iris Data Set 
; https://archive.ics.uci.edu/ml/datasets/iris

즉, 결괏값이 택시 요금 예측과 같이 연속 공간이 아니라, 데이터 파일 자체에 포함된 Label(붓꽃 데이터의 경우 class) 집합으로 한정되기 때문에 "다중 분류" 시나리오가 됩니다.

그럼 Python 예제만 있는 붓꽃 분류를 ^^ C# ML.NET으로 해보겠습니다.

우선, 위의 사이트에서 다운로드한 iris.data는 CSV 형식의 파일이지만 아쉽게도 칼럼 정보가 없습니다. 대신 iris.names 파일을 보면 다음과 같이 속성 정보가 있으니,

1. sepal length in cm 
2. sepal width in cm 
3. petal length in cm 
4. petal width in cm 
5. class: 
 -- Iris Setosa 
 -- Iris Versicolour 
 -- Iris Virginica

이를 참고해 iris.data의 첫 행에 다음과 같이 칼럼 정보를 넣고 파일명을 .csv를 붙여 저장합니다.

sepal_length,sepal_width,petal_length,petal_width,class
5.1,3.5,1.4,0.2,Iris-setosa
4.9,3.0,1.4,0.2,Iris-setosa
...[생략]...

끝입니다 이제 Model Builder를 실행해 다음과 같은 설정으로 자동 코드를 생성하고,

1. Scenario
    Custom Scenario

2. Data
    Input: File
    Select a file: iris.data.csv
    Column to Predict (Label): class

3. Train
    Machine learning task: multiclass-classification
    Time to train (seconds): 10

자동 코드가 생성되었으면 역시 우리의 응용 프로그램 프로젝트에 다음과 같은 설정을 한 후,

1) Install-Package Microsoft.ML
2) MLModel.zip 추가 -  "Copy to Output Directory" - "Copy if newer"
3) ModelInput.cs, ModelOutput.cs 추가

간단하게 붓꽃 판정 코드를 만들 수 있습니다. ^^

using ConsoleApp1ML.Model.DataModels;
using Microsoft.ML;
using System;

namespace ConsoleApp2
{
    class Program
    {
        static void Main(string[] args)
        {
            MLContext mlContext = new MLContext();

            ITransformer mlModel = mlContext.Model.Load("MLModel.zip", out DataViewSchema inputSchema);
            var predEngine = mlContext.Model.CreatePredictionEngine<ModelInput, ModelOutput>(mlModel);

            ModelInput sampleData = new ModelInput
            {
                Sepal_length = 5,
                Sepal_width = 2.9f,
                Petal_length = 1,
                Petal_width = 0.2f,
            };

            ModelOutput predictionResult = predEngine.Predict(sampleData);

            Console.WriteLine($"Single Prediction --> Predicted value: {predictionResult.Prediction} | Predicted scores: [{String.Join(",", predictionResult.Score)}]");
        }
    }
}

/* 출력 결과
Single Prediction --> Predicted value: Iris-setosa | Predicted scores: [0.8280767,0.1602236,0.01169968]
*/

엄청 쉽죠? ^^

(첨부 파일은 이 글의 예제 코드를 포함합니다.)




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]

[연관 글]






[최초 등록일: ]
[최종 수정일: 5/12/2019]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




[1]  2  3  4  5  6  7  8  9  10  11  12  13  14  15  ...
NoWriterDateCnt.TitleFile(s)
14036정성태10/25/2025888디버깅 기술: 224. Visual Studio - 디버깅 시 다른 함수의 소스 코드를 보여주는 사례 (Enable COMDAT Folding 옵션)파일 다운로드1
14035정성태10/24/2025813C/C++: 189. Visual C++ - 디버그 코드에서 빌드 옵션 조정으로 최적화 코드로의 전환파일 다운로드1
14034정성태10/22/20251000닷넷: 2375. C# - dynamic 사용 시 internal 멤버에 대한 RuntimeBinderException 예외가 발생하는 문제파일 다운로드1
14033정성태10/22/20251366닷넷: 2374. C# - dynamic과 "Explicit Interface Implementation"의 문제파일 다운로드1
14032정성태10/21/20251067닷넷: 2373. C# - dynamic 예약어 사용 시 런타임에 "Microsoft.CSharp.RuntimeBinder.RuntimeBinderException" 예외가 발생하는 경우파일 다운로드1
14031정성태10/20/2025957Linux: 128. "USER ..." 설정이 된 Docker 컨테이너의 호스트 측 볼륨 권한 (2)
14030정성태10/20/20251230Linux: 127. "USER ..." 설정이 된 Docker 컨테이너의 호스트 측 볼륨 권한
14029정성태10/17/20251774닷넷: 2372. C# - ssh-ed25519 유형의 Public Key 파일 해석파일 다운로드1
14028정성태10/17/20251778오류 유형: 985. openssh - ssh_host_ed25519_key 파일을 로드하지 못하는 문제
14027정성태10/15/20251782닷넷: 2371. C# - CRC64 (System.IO.Hashing의 약식 버전)파일 다운로드1
14026정성태10/15/20252283닷넷: 2370. 닷넷 지원 정보의 "package-provided" 의미
14025정성태10/14/20252351Linux: 126. eBPF (bpf2go) - tcp_sendmsg 예제
14024정성태10/14/20252845오류 유형: 984. Whisper.net - System.Exception: 'Cannot dispose while processing, please use DisposeAsync instead.'
14023정성태10/12/20252857닷넷: 2369. C# / Whisper 모델 - 동영상의 음성을 인식해 자동으로 SRT 자막 파일을 생성 [1]파일 다운로드1
14022정성태10/10/20253171닷넷: 2368. C# / NAudio - (AI 학습을 위해) 무음 구간을 반영한 오디오 파일 분할파일 다운로드1
14021정성태10/6/20253534닷넷: 2367. C# - Youtube 동영상 다운로드 (YoutubeExplode 패키지) [1]파일 다운로드1
14020정성태10/2/20252984Linux: 125. eBPF - __attribute__((preserve_access_index)) 활용 사례
14019정성태10/1/20253184Linux: 124. eBPF - __sk_buff / sk_buff 구조체
14018정성태9/30/20252357닷넷: 2366. C# - UIAutomationClient를 이용해 시스템 트레이의 아이콘을 열거하는 방법파일 다운로드1
14017정성태9/29/20252838Linux: 123. eBPF (bpf2go) - BPF_PROG_TYPE_SOCKET_FILTER 예제 - SEC("socket")
14016정성태9/28/20253188Linux: 122. eBPF - __attribute__((preserve_access_index)) 사용법
14015정성태9/22/20252541닷넷: 2365. C# - FFMpegCore를 이용한 MP4 동영상으로부터 MP3 음원 추출 예제파일 다운로드1
14014정성태9/17/20252478닷넷: 2364. C# - stun.l.google.com을 사용해 공용 IP 주소와 포트를 알아내는 방법파일 다운로드1
14013정성태9/14/20253559닷넷: 2363. C# - Whisper.NET Library를 이용해 음성을 텍스트로 변환 및 번역하는 예제파일 다운로드1
14012정성태9/9/20253743닷넷: 2362. C# - Windows.Media.Ocr: 윈도우 운영체제에 포함된 OCR(Optical Character Recognition)파일 다운로드1
[1]  2  3  4  5  6  7  8  9  10  11  12  13  14  15  ...