태양광 예측 / 집합자원 최적화

DSC6 연구 현황

현황을 불러오는 중

현재 작업과 자원 현황

실행 기록을 연결하는 중

진행 기록 연결 중

최근 실행 기록

    실행 기록을 연결하는 중

    Windows RAM연결 중
    커밋 메모리연결 중
    GPU VRAM / 연산 사용률연결 중
    호스트 CPU / WSL 메모리연결 중

    현재 표본을 기다립니다. 지난 학습의 자원 값을 현재 사용량으로 표시하지 않습니다.

    남은 작업과 실행 순서

    계획을 연결하는 중

    계획 단계 완료미확인
    남은 단계미확인
    실행 중인 단계미확인무거운 연산은 동시에 최대 1개
    후속 연구 후보미확인현재 실행 단계와 구분
    전체 단계와 다음 실행 이유 보기

      현재 연구 후보의 순서와 비교 방법

      먼저 전처리, 모델 구조, 자기지도학습과 학습 조합을 비교합니다. 앙상블과 seed 반복은 마지막 단계입니다. 아래 순서는 실행 승인이 끝난 작업 수와 다르며, 단계별 범위와 예산을 검토한 뒤 실행합니다.

      실행 상태확인 중학습, 검증, 추론과 종료를 구분합니다.
      Epoch확인 중
      Iteration / 현재 epoch 배치확인 중
      예상 남은 시간계산 중

      Train evalValid

      Epoch별 실측 값 보기
      EpochTrain L1Valid L1

      곡선은 각 epoch 종료 시 같은 모델의 eval 모드에서 측정한 값만 표시합니다. Valid가 나오기 전에는 보간하거나 예상값으로 채우지 않습니다. 완료 실행의 원래 곡선도 위 선택 목록과 보존 기록에서 확인할 수 있습니다.

      공개 집계는 45초 간격으로 전송하고 화면은 15초마다 새 집계를 확인합니다. GitHub 공개 원문은 최신본을 약 1분 간격으로 반영하므로 화면의 기록은 보통 1~2분 이내입니다. 2분 30초를 넘으면 지연, 10분을 넘으면 중단으로 표시하고 남은 시간 추정을 숨깁니다. 실행 감독 기록의 지연은 게시 시점 기준으로 따로 판단합니다.

      현재 성과

      기반 검증
      검토된 평가 최저 W미측정리더보드 점수와 구분해 표시
      발전소 / 총 설비용량253 개소42,655.370 kW / 두 집합 각각 20 MW 이상
      최초 원본 감사의 완전 관측3,802 시간2024.12.24 이후의 원본 집계 / 모델별 평가 시간과 구분
      최종 검증 구간라벨 봉인5월 팀 집계 간접 노출 기록 / 자동 모델 선택 제외

      지금 하는 일

      데이터와 검증 환경 준비

      최적화 목표

      수익 S = 매전수익 − W

      W = 0.1 × Σ SMP × k × 집합 절대오차

      예측 개선과 배분 개선의 효과를 분리해 측정합니다.

      현재 판단과 기록

      순위 자료 연결 중
      순위에 반영된 모델확인 중검토된 순위 자료 연결 중
      현재 비교의 새 학습확인 중실행 기록 연결 중
      검토된 모델의 최저 W확인 중측정된 W 확인 중

      순위에 반영된 모델과 새 학습의 진행을 구분합니다.

      실시간 진행 연결 대기

      현재 실행

      실행 기록 연결 중

      마지막으로 순위에 반영된 결과

      검토된 결과 연결 중

      실시간 학습 기록 검토된 모델 순위

      가설과 실행 기록 연결 중

      두 모델을 같은 조건에서 비교

      정산 W / 낮을수록 좋음

      기간A 기준 W (원)B 후보 W (원)B 변화율

      배분만 바꿔 줄일 수 있는 폭의 상한

      위에서 고른 구간의 동결 예측입니다. 하한을 측정하지 않은 봄 후보는 미측정으로 표시합니다. 모든 잔차를 합친 절댓값은 두 집합의 절대오차 합보다 작거나 같습니다. 용량 제약과 모든 시간에 하나의 배분을 쓰는 조건까지 고려하면 실제 이득은 더 작을 수 있습니다.

      파랑: 이론 하한 노랑: 하한까지 남은 차이

      모델현재 W와 하한현재 W (원)이론 하한 (원)최대 여지 (원 / 비율)

      하한은 찾은 배분이나 달성한 개선이 아닙니다. 이 하한이 E02의 실제 W보다 높다면 해당 고정 예측을 배분 변경만으로 E02보다 좋게 만들 수 없습니다.

      모델 순위

      성능 순위모델정산 S (원)페널티 W (원)1위 대비 W절대오차 합계 (kWh)공식 정규화 점수공통 관측학습 완료 (KST)

      정규화 점수는 공식 기준선 확인 전입니다. 1위 대비 W 변화율과 다른 값입니다.

      최근 학습과 모델 선택

      이전 학습 기록
      공통 봄 입력 / 모델 계열 비교

      지금 진행하는 모델 비교

      실시간 실행 기록 연결 중

      1D CNN은 8개 epoch 평가 후 9번째 학습 중 중단됐습니다. 저장본을 검토했고 순위는 유지합니다. LightGBM과 CatBoost 각 한 설정을 우선 비교하고, Stacked LSTM, Random Forest, Extra Trees, Ridge, Elastic Net, MLP와 TCN을 함께 검토합니다. 완료 검토 전 모델은 위 성능 순위에 추가하지 않습니다.

      추가 모델별 검토 범위와 현재 한계
      모델검토할 차이현재 상태와 실행 조건
      LightGBM / CatBoost트리 부스팅, 각 한 초기 설정합성 GPU 저장 연결 완료. 24시간 입력의 전체 native 메모리와 실제 W 선택 연결 후 순차 실행
      Stacked LSTM2층, 방향당 hidden 32의 양방향 후보같은 전일 17시의 24시간 예보와 mask 사용. 실제 학습 전이며 padding 상태와 저장 연결 검토가 남음
      Random Forest / Extra Trees부트스트랩 숲과 임의 분할 숲, 각 한 초기 설정트리 수, 깊이, leaf와 입력 메모리 상한부터 고정. 현재 소프트웨어의 CPU/GPU 경로 확인 전에는 실행 준비됨으로 세지 않음
      Ridge / Elastic Net규제 선형 대조군, 각 한 초기 설정행렬 전체 복제 없이 같은 정보, 가중치와 W로 비교할 적재 경로 검토
      MLP / TCN / GRU / 기타 전통 모델시계열 구조의 이득과 더 단순한 대안MLP와 TCN은 후속 초기 후보. GRU, XGBoost, 단일 트리, Huber 회귀, KNN, SVR도 비용과 중복을 검토해 실행 또는 보류 사유 기록

      이 표는 검토 계획입니다. 아직 측정하지 않은 모델의 성능이나 실행 시간을 예상값으로 채우지 않습니다. 입력 정보, 범주 표현이나 학습 손실이 다르면 구조 하나의 효과로 해석하지 않습니다. 모델 계열로서의 숲 비교와 최종 후보 모델을 섞는 앙상블은 별개이며, 후자는 seed 반복과 함께 마지막 단계입니다.

      봄 개발 구간 / H03F

      실제로 완료한 구조와 학습률 탐색

      검토한 탐색 결과를 불러오는 중

      봄 개발 구간 / H03D

      실제 정산 W로 고른 Transformer

      완료 및 보존 검토 후 실제 정산 곡선을 표시합니다. 실행 중 진행은 위 실시간 영역에서 확인할 수 있습니다.

      2월 1일 01시부터 27일 17시까지의 641시간을 모델 선택에 사용합니다. 반복 개발 구간이므로 기존 겨울 모델의 2월 평가 순위와 합치지 않습니다. 학습 gradient는 발전소별 L1이며, best와 조기 종료를 집합 W로 결정합니다.

      설계: 폭 32, 4헤드, 2층 Transformer. 발전소별 24시간 예보의 142개 특징과 결측 표시를 받아 시간별 용량 대비 발전량을 출력합니다. kWh 변환과 태양고도에 따른 야간 0 처리는 기존 예측 규칙을 유지합니다. AdamW LR 0.0003, seed 17, batch 8 / accumulation 2입니다.

      선택 기준: 집합 W

      보조 진단: Train / Valid L1

      주황 실선은 Train, 파랑 점선은 Valid입니다. 큰 점은 W로 선택한 epoch이며, L1 최저는 아래 표에서 구분합니다.

      봄 학습의 전체 epoch 수치와 선택 이유 보기
      EpochTrain L1Valid L1정산 S, 원페널티 W, 원집합 절대오차, kWh

      모델 구조와 입출력

      실행한 모델과 미실행 후보 구분

      모델을 선택하면 입력, 학습 목적, 출력 변환과 저장 상태를 볼 수 있습니다. 가중치 파일은 공개하지 않습니다. 근거 경로와 해시는 로컬 또는 비공개 저장소에서 재검토할 때 사용합니다. 가장 최근에 선택한 H03F의 폭 64, 2층 구조와 8개 후보 전체는 탐색 결과에서 볼 수 있습니다.

      다음 비교 후보와 제외한 방법

      가설과 행동 근거

      검토용 집계 JSON

      기대 → 반증 조건 → 관찰 → 판단 → 다음 행동의 이유를 연결합니다. 실행 전 가설과 결과를 본 뒤의 정리를 구분합니다. 원본 실행 기록은 보존하고 이 판단 기록의 변경은 Git으로 추적합니다.

      최근 판단 3건을 먼저 표시합니다. 이전 판단과 근거도 모두 보존합니다.

      이전 판단 기록 보기

      입력 데이터와 전처리

      관측 집계와 미실행 후보 구분

      검토한 데이터 집계를 불러오는 중

      D11과 P08b는 fit 예보 문맥을, D12는 같은 기간의 원 기상과 원 발전량 라벨을 검사했습니다. 발전량은 별도 라벨이며 기상 입력과 섞지 않습니다. 2~4월 검증과 5월 봉인 자료는 데이터 품질 집계에서 제외합니다. 같은 예보가 여러 발전소에 반복되므로 행 수가 독립 관측 수는 아닙니다.

      먼저 알아둘 데이터의 형태

      표 데이터를 하루 24시간 시계열로 묶습니다

      원본은 CSV와 Parquet 형식의 tabular data입니다. Parquet도 행과 열을 가진 표의 저장 형식입니다. 발전소 정보, 시간별 발전량, 두 제공사의 기상 예보와 전력 가격을 키로 연결합니다. 현재 모델에는 이미지, 음성, 자유 서술문이 들어가지 않습니다.

      1. 1. 원본 표발전소 정보 + 발행 시각이 있는 기상 예보발전소 × 목표 시각
      2. 2. 특징 표한 발전소의 한 시간마다 수치화된 특징 142개월별 Parquet
      3. 3. 시계열 입력발전소별 하루 24개 슬롯 + 결측 표시 + padding 표시[batch, 24, 142]

      위 흐름은 H03F/P08c/P10의 기존 142개 입력입니다. P09c는 같은 원본 특징 표를 배치마다 149개 수치와 3개 범주 ID로 변환하며 전체 변환표를 복제하지 않습니다. batch는 한 번에 묶는 발전소-일 표본 수이며 batch 8을 사용합니다. 발전량 정답은 예보 특징에 섞지 않고 별도 라벨과 손실 마스크로 연결합니다.

      각 원본 표의 한 행, 연결 키와 쓰임
      원본 형식한 행의 뜻 / 연결 기준주요 내용과 단위현재 사용
      sites.csv발전소 하나 / site_id설비용량 kW, 비식별 좌표, A/B 관측소 연결과 거리 m253개소의 정적 정보
      generation.parquet발전소 하나의 한 시간 / site_id + ts시간 구간의 발전량 kWh지도학습의 정답. 행 누락과 관측된 0은 구분
      forecast_wa/wb.parquet관측소 + 예보 회차 + 목표 시각원본 기상 변수 A 10개 / B 20개. 현재 특징에는 A 8개 / B 20개 사용전날 10시와 17시 발행 예보를 연결
      observed_wa/wb.parquet관측소의 관측 시각별 기상실측 기상 표, 예보와 역할이 다름제공되지만 현재 142개 특징 생성에는 미사용
      smp.csv / train/smp.csv시간별 가격 / ts가격은 원/kWh. 평가용에는 k 열이 있으며 학습용 k는 시각 규칙으로 계산학습 구간의 손실 가중과 각 구간의 정산 계산

      위 키는 스키마 이름이며 실제 발전소 ID나 원본 행은 게시하지 않습니다. 저장 dtype을 전 열에 대해 다시 조사한 결과는 아닙니다.

      시각과 단위를 읽는 법

      발행 시각과 목표 시각

      r10과 r17은 전날 예보를 발행한 10시와 17시입니다. 예측하려는 시간은 따로 있습니다. ts는 KST 한 시간 구간의 끝입니다. 예를 들어 01시는 00~01시, 다음 날 00시는 전날의 마지막 구간입니다.

      같은 변수 이름도 단위를 확인

      기존 가공 표에는 A 풍속 m/s, B 풍속 km/h와 A 강설량 mm, B 강설량 cm가 남아 있습니다. 새 전처리 경로는 풍속을 m/s, 강설량을 mm로 통일합니다. 원 단위와 환산식을 보존하며 아래 감사 패널에서 변환 전후를 비교할 수 있습니다.

      확인한 것과 미확인인 것

      아래 사전은 제공 명세의 단위와 코드에서 유도한 단위를 구분합니다. 강수·강설의 누적 시간 구간은 미확인이므로 mm/h라고 쓰지 않습니다. fit 예보 특징의 최소, 최대, 분위수와 가공 저장 dtype은 아래 P08b에서 실측했습니다. D12에서 fit 발전량의 분포와 CSV 원문의 소수 자릿수를 추가로 확인했습니다. CSV에는 Parquet과 같은 고정 dtype 선언이 없어 문자열 표기와 파싱된 수치형을 구분합니다.

      P09c 유형별 입력과 ID 비교 완료

      새 입력 표현 3개를 비교했고 기존 대조를 유지합니다

      유형별 149개 수치에 기존 ID 수치, one-hot, ID별 8차원 embedding을 연결했습니다. 같은 64폭 2층 Transformer, seed 17, 원 단위 0 대체, 전날 17시 입력과 253개소의 641시간 W를 사용했습니다. 수치 표현 여러 개를 함께 바꿨으며 ID 분기의 파라미터 수도 다르므로 개별 변환이나 동일 모델 크기의 효과로 해석하지 않습니다.

      검토한 완료 결과를 읽는 중입니다.

      새 후보 중 embedding의 W가 가장 낮지만 기존 대조보다 7.04% 높았습니다. 세 후보 모두 승격하지 않습니다. 기존 대조는 재학습하지 않았으며 P10 문맥 혼합과 D15 과거 실측 정제는 이 비교에 적용하지 않았습니다. 반복 개발 선택값으로 독립 검증은 아닙니다. 다음은 LightGBM, CatBoost, 1D CNN 각 한 초기 설정의 공통 봄 비교입니다.

      P10 실제 문맥 대체 학습 완료

      예보를 더 잘 채워도 발전량 W는 나빠질 수 있습니다

      동일한 64폭 2층 모델과 seed 17, 학습 조건에서 대체 방법만 바꿨습니다. 새 혼합 모델 1개를 16 epoch 학습했고, 기존 원 단위 0 모델은 재사용했습니다. 반복 개발한 2월 641시간의 선택값으로 독립 검증이 아닙니다. W는 낮을수록 좋습니다.

      검토한 완료 결과를 읽는 중입니다.

      fit 원변수 118,428셀을 대체했고 의존 특징까지 254,622입력셀이 달라졌습니다. valid 입력 변경은 0셀입니다. 원래 결측 표시와 관측 0을 유지했고 발전량 정답은 채우지 않았습니다. 이후 P09c의 수치 표현과 ID 인코딩 비교도 완료했으며 위 별도 패널에 보존했습니다.

      P08c 실제 결측 대체 비교 완료

      평균, 중앙값, 원 단위 0을 같은 구조에서 비교했습니다

      64폭 2층 Transformer와 seed 17, 학습 조건을 고정하고 자연 결측 대체값만 바꿨습니다. 평균 대조는 H03F의 저장 모델을 재사용했고 중앙값과 원 단위 0을 각각 16 epoch 학습했습니다. 결측 표시와 관측 0은 유지합니다. 반복 개발한 2월 641시간의 선택값이며 독립 검증이나 겨울 전체 월 순위가 아닙니다. 학습은 발전소 L1, 선택은 집합 W입니다.

      평균 대조 1개는 재학습하지 않았습니다. 각 후보의 실측 16개 점을 별도로 표시하며 새 학습량은 32 epoch입니다. 작은 선택값 차이만으로 다른 기간의 우위를 확정하지 않습니다.

      선택한 방법의 모든 epoch 수치
      D12 원자료 의심값 검토

      의심값, 표기 경향과 주변 증거를 비교합니다

      이전 실측 B에서 운량 100 초과 433건, 풍속 200 km/h 초과 230건, UV 15 초과 394건이 같은 2021년 11월 구간에 겹쳤습니다. 운량 이상 433건 중 기압 0도 365건입니다. 9,144와 7,315.2는 각각 30,000ft와 24,000ft의 미터 환산값입니다. 소수점 누락 외에 필드 혼입 가능성도 있으며, D12 감사 당시에는 수정하지 않았습니다. 이후 D15에서 승인된 해당 필드만 별도 정제본에 격리했습니다. 실측 기상은 현재 모델 입력에 사용하지 않습니다.

      검토한 데이터 품질 집계를 불러오는 중

      원자료는 보존하며 D15의 승인된 격리는 별도 정제본에만 적용했습니다. 운량의 100% 초과와 상대습도의 100% 초과는 다르게 검토합니다. 상대습도는 과포화에서 100%를 넘을 수 있습니다. 실제 사례가 정확하다는 보장은 아니므로 주변 기록과 함께 봅니다. 자세한 행 목록과 앞뒤 시각은 로컬 검토 파일에 보존합니다.

      숫자가 맞는 최소 소수 격자

      Parquet는 숫자를 저장하므로 91.4와 91.40의 원래 표기 차이는 알 수 없습니다. 아래 자릿수는 계측 정밀도를 뜻하지 않습니다.

      극값 목록

      격자별 전체 수치
      최소 격자관측 수비율
      변수별 의심 규칙과 발생 건수

      규칙별 중복이 있으며 건수의 합은 고유 원자료 행 수가 아닙니다. 풍속, UV, 시정의 검토 기준 초과는 곧바로 오류를 뜻하지 않습니다. 기준은 기상 품질관리의 범위·모순·주변 기록 점검 원칙을 참고해 구분했습니다.

      자료변수검토 규칙건수해당 자료 행 대비

      기존 모델에서 ±12 밖이었던 셀 수
      특징셀 수관측 대비최대 |z|

      현재 학습 예보: 짧은 결측과 하루 대부분의 결측

      실제 결측 문맥 집계를 불러오는 중

      A의 원 17시 예보는 4개 관측소에서 2시간 결측, 1시간 관측 배치가 나타났습니다. B의 10시 예보는 73개 관측소 모두에서 하루 앞 23시간의 20개 변수가 함께 빠졌습니다. 규칙적인 모양만으로 수집 장애나 원 데이터 해상도를 확정하지 않습니다.

      그림은 실측 결측 메타데이터의 같은 하루 배치를 관측소별로 묶은 것입니다. 여러 발전소에 복제된 같은 예보는 한 번만 셉니다. A의 32개 구간은 관측소 4개 × 각 8구간이고, B의 73개 구간은 관측소별 한 구간입니다.

      현재 입력: A의 17시 원 결측은 같은 목표 시각의 10시 예보로 이미 대체했습니다. B의 10시 결측은 입력에 남아 있고, 그 시각의 17시 예보는 별도 열에 있습니다. 두 경우 모두 다른 회차의 값이 당시 17시 예측 기준 시각까지 가용했습니다. 이는 결측값의 실제 정답이 아닙니다.

      선택 회차의 변수별 건수와 집계 단위

      원 예보 키는 관측소·목표 시각·발행 회차입니다. 발전소 행 수는 같은 예보가 여러 발전소로 복제된 횟수를 포함합니다. 건수를 변수 수만큼 다시 더하면 변수 셀 수가 됩니다.

      원 변수원 결측 키원 결측 발전소 행기존 대체 후 결측 발전소 행다른 회차 가용 키동일 회차 양쪽 이웃 가용 키

      이 결과로 바뀐 대체 비교

      같은 목표 시각의 다른 가용 회차를 첫 비교 기준으로 추가합니다. A의 짧은 구간에는 제한 보간을 비교하고, B의 23시간 구간은 양쪽 이웃이 없어 보간과 한쪽 값 연장을 구분합니다. B 10시의 다른 변수도 함께 빠지므로 같은 회차의 기온·습도만으로 KNN 거리를 만들 수 없습니다.

      유사 사례는 당시 남아 있는 다른 회차, 다른 제공사의 예보와 시간·계절 조건을 사용합니다. 같은 발전소에 연결된 A/B 관측소라는 관계는 물리적 근접성의 증거가 아닙니다. D14에서 2시간 반복 블록과 23시간 블록의 여러 변수를 함께 가려 여섯 방법을 비교했습니다. 이후 D15의 군집 비교와 D16의 변수별 혼합 선택을 거쳐 P10에서 발전량 모델 1개를 실제 학습했습니다. 같은 641시간 W는 원 단위 0 대조보다 6.34% 높아 채택하지 않았습니다. 아래 복원 오차와 위 P10 발전량 평가를 구분합니다.

      결측 복원 비교: 시간 이웃과 유사 사례

      검토한 복원 비교를 불러오는 중

      A의 짧은 결측에서는 3시간 제한 보간이 8개 변수 중 5개, 다른 회차가 3개에서 평균 절대오차가 가장 작았습니다. B의 긴 결측에서는 다른 회차가 20개 중 19개에서 가장 작고, 착빙량 1개는 모든 방법이 0으로 동률입니다. 이번 제한 KNN과 유사 날 방법은 이 기준들을 넘지 못했습니다. 모든 KNN 설계가 나쁘다는 결론은 아닙니다.

      월별로도 항상 같은 순서는 아닙니다. A 강설은 보간과 다른 회차가 8개월 중 7개월 동률이고, 한 달의 차이로 전체 평균이 갈렸습니다. 0이 많은 변수의 작은 전체 오차를 모든 상황의 복원 능력으로 해석하지 않습니다.

      이웃 사전과 거리 통계는 2023년 6월~2024년 5월, 질의는 그 뒤 2024년 6월~2025년 1월입니다. 제공사별 8개 관측소와 16개 질의 날짜를 고정 선택했고 원 예보 복제 행을 중복 이웃으로 세지 않았습니다. 실제 결측과 같은 여러 변수 동시 부재를 재현한 제한 비교이며, 자연 결측의 숨은 정답을 확인한 실험은 아닙니다.

      퍼센트 변수의 오차는 퍼센트포인트(%p)입니다. A/B 풍속은 표시에서 m/s, 강설은 mm, 시정은 m로 맞췄습니다. 이는 보존된 복원 오차의 단위 환산이며 새 학습 효과가 아닙니다. 단위가 다른 변수의 오차를 더해 종합 점수를 만들지 않습니다.

      방법평균 절대오차중앙 절대오차95% 절대오차RMSE이웃 간 표준편차

      월별 오차 전체 수치
      이웃 조건과 방법의 차이

      시간 보간은 같은 발행일 안에서 양쪽 각각 3시간 이내인 값만 연결하고, 한쪽만 가까우면 연장합니다. B의 앞 23시간 중 20시간은 이 제한을 만족하지 못해 앞선 기간 기준값으로 돌아갑니다. 별도의 긴 연장 방법은 최대 23시간을 그대로 늘렸습니다.

      KNN은 같은 관측소의 앞선 최대 1,152시간 중 5개를, 유사한 하루는 최대 48일 중 24시간 패턴이 가까운 3일을 고릅니다. 조건에는 가리지 않은 다른 회차, 타 제공사의 두 회차 기상과 시간·계절을 씁니다. 가린 회차 원값과 그 파생열은 제외하고 숫자 ID를 거리로 사용하지 않았습니다. 방향은 원형으로 평균합니다. 선택된 관측소와 날짜는 서로 상관돼 있으므로 독립 표본이나 확정 유의성으로 주장하지 않습니다.

      현재 모델 입력은 그대로입니다. 원래 없던 값의 복구 정확도, 다른 기상 상황과 발전량 W에 대한 효과는 별도 통제 비교가 필요합니다. 앙상블과 seed 반복은 마지막에 진행합니다.

      D15: 승인된 결측 격리와 군집 대체 비교 완료

      453개 관측 키의 1,473개 필드를 별도 정제본에서 결측으로 격리했습니다. 상충 중복 6개 키의 충돌 필드 37개도 포함합니다. 원자료와 양쪽 중복 원행은 보존하고, 정상 0·높은 상대습도·시정·반복 소수는 일괄 삭제하지 않았습니다. 과거 실측 기상은 현재 예보 모델의 입력에 미사용이며, 이 정제를 모델 성능 개선으로 세지 않습니다.

      남은 변수로 만든 군집 평균, 군집 보정, KNN 보정을 실제 비교했습니다. 같은 과거 donor와 4,992개 예보 키의 75,264셀을 사용했습니다. 세 설정 모두 다른 회차 대체 기준에 비해 채택 조건을 만족하지 못했습니다. 특정 후보 풀과 설정의 결과이며 KNN 계열 전체의 한계를 뜻하지 않습니다.

      군집은 8개, KNN은 5개 이웃입니다. 보정 방법은 다른 회차 예보에 과거 유사 사례의 회차 차이를 더합니다. 채택 조건은 MAE 5% 이상 감소, 8개월 중 최소 6개월 개선, 95% 절대오차 비증가였습니다. 미래 donor·가린 값·그 파생열·숫자 ID 거리는 제외했습니다.

      28개 변수의 평균 절대오차 비교

      낮을수록 좋습니다. 퍼센트는 %p, 풍향은 짧은 원형 거리입니다. 풍속 m/s, 강설 mm, 시정 m로 표시 단위를 맞췄습니다. 단위가 다른 오차를 합산하지 않습니다.

      변수오차 단위다른 회차군집 평균군집 보정KNN 보정
      A 운량 wa_cloud퍼센트포인트 (%p)9.3110433.8299.9341113.495
      A 기온 wa_temp°C0.28295.57670.2883780.390098
      A 상대습도 wa_humidity퍼센트포인트 (%p)1.8950212.17222.10852.70931
      A 지표기압 wa_ground_presshPa0.2587894.586990.3425770.397854
      A 풍속 wa_wind_speedm/s0.2635791.190760.2704610.352575
      A 풍향 wa_wind_dir°12.64759.321412.9317.2517
      A 강우량 wa_rainmm0.079790.1669960.09994650.097022
      A 강설량 wa_snowmm0.005268550.01281120.007906830.00651002
      B 기온 wb_temp°C0.2387155.319560.2552750.308261
      B 체감온도 wb_feel_temp°C0.4159126.443260.4487350.529475
      B 습구온도 wb_wet_bulb_temp°C0.164934.77730.1799490.218579
      B 이슬점 wb_dew_point°C0.1751215.259930.1983080.24587
      B 풍속 wb_wind_speedm/s0.2636391.052530.2783940.315126
      B 풍향 wb_wind_dir°21.25170.955521.708624.1083
      B 순간최대풍속 wb_wind_gust_spdm/s0.5183322.243390.5483310.626536
      B 상대습도 wb_rel_hum퍼센트포인트 (%p)1.2228311.21231.30361.5941
      B 시정 wb_vism877.914381.291100.841312.58
      B 운고 wb_ceilingm682.4152648.45735.958826.497
      B 자외선지수 wb_uv_idx지수 (물리 단위 없음)0.2027851.292430.2142850.231763
      B 강수확률 wb_precip_prob퍼센트포인트 (%p)2.2781910.0662.716093.16524
      B 강우확률 wb_rain_prob퍼센트포인트 (%p)2.261559.885932.701193.14505
      B 강설확률 wb_snow_prob퍼센트포인트 (%p)0.01019020.4183420.01146860.0148207
      B 결빙확률 wb_ice_prob퍼센트포인트 (%p)00.06453800
      B 총 강수량 (물환산) wb_total_liqmm0.07946130.1796030.1131330.196384
      B 강우량 wb_rainmm0.07946130.1791280.1131330.196384
      B 강설량 wb_snowmm00.030567500
      B 착빙량 wb_icemm0000
      B 운량 wb_cloud퍼센트포인트 (%p)14.31934.107214.740515.6703

      P10 실제 학습 완료: D16의 다섯 변수 혼합과 나머지 변수의 다른 회차 대체로 16 epoch를 학습했습니다. 같은 2월 641시간 W는 13,734,154원으로 원 단위 0 대조보다 6.34% 높았습니다. 예보 복원 오차 개선과 발전량 W 개선은 다르며 이번 모델을 승격하지 않습니다. 원본, 정제본과 대체 출처는 모두 보존합니다.

      제공 데이터만 사용하는 과거 fit 비교입니다. 대회 공식 안내의 외부 데이터·외부 사전학습 모델 금지와 전날 17시 정보 경계를 지킵니다. 특정 알고리즘의 개별 승인을 받았다는 뜻은 아닙니다.

      D16: 변수별로 대체값을 섞어 비교했습니다

      사용자 제안대로 결측 대체의 혼합도 비교했습니다. 연속값은 가중평균, 풍향은 원형 평균입니다. 앞선 2024년 6~9월에 변수별 29개 조합 중 비율을 정하고, 뒤 10월~2025년 1월에 바꾸지 않고 적용했습니다. 보존된 복원 예측을 재사용했으며 기존 방법이나 발전량 모델을 다시 학습하지 않았습니다.

      A 운량·기온·습도·풍속·풍향은 시간 보간과 다른 회차의 혼합을 채택했습니다. 시간 추정의 비중은 각각 75%, 25%, 50%, 50%, 50%입니다. 기압·강수·강설과 B 변수는 다른 회차를 유지합니다. 후반 MAE 5% 이상 개선, 4개월 중 3개월 이상 개선, 95% 절대오차 비증가 조건을 적용했습니다. A 강수 혼합은 뒤 구간에서 평균 오차가 늘어 채택하지 않았습니다.

      이는 이미 본 fit 구간의 예보 복원 결과로 독립 검증이 아닙니다. 결측 대체의 가중치도 데이터에서 추정한 전처리입니다. 발전량 모델 앙상블과 seed 반복은 마지막에 둡니다. P10은 이 조합의 실제 학습을 완료했으나 W가 대조보다 6.34% 높았습니다. 아래의 채택은 예보 복원 단계의 당시 판단이며 발전량 모델 승격을 뜻하지 않습니다.

      28개 변수의 후반 4개월 오차와 채택 여부

      시간 비중은 앞선 구간에서 선택한 후보의 비율입니다. 채택 조건 미달이면 실제 적용 비율은 0, 즉 다른 회차 유지입니다. 전후 오차는 모두 같은 후반 구간입니다.

      변수오차 단위선택 후보 시간 비중다른 회차 MAE혼합 MAE개선 월적용 판단
      A 운량퍼센트포인트 (%p)0.759.90827.376714/4혼합 채택
      A 기온°C0.250.3042090.2479264/4혼합 채택
      A 상대습도퍼센트포인트 (%p)0.52.34181.609214/4혼합 채택
      A 지표기압hPa0.00.3242190.3242190/4다른 회차 유지
      A 풍속m/s0.50.2572750.1944254/4혼합 채택
      A 풍향°0.512.37411.25363/4혼합 채택
      A 강우량mm0.750.03524410.03636232/4다른 회차 유지
      A 강설량mm0.00.01053710.01053710/4다른 회차 유지
      B 기온°C0.00.1705920.1705920/4다른 회차 유지
      B 체감온도°C0.00.258530.258530/4다른 회차 유지
      B 습구온도°C0.00.1275670.1275670/4다른 회차 유지
      B 이슬점°C0.00.1154890.1154890/4다른 회차 유지
      B 풍속m/s0.00.0872520.0872520/4다른 회차 유지
      B 풍향°0.012.592412.59240/4다른 회차 유지
      B 순간최대풍속m/s0.00.1755360.1755360/4다른 회차 유지
      B 상대습도퍼센트포인트 (%p)0.00.8478260.8478260/4다른 회차 유지
      B 시정m0.0593.531593.5310/4다른 회차 유지
      B 운고m0.0466.373466.3730/4다른 회차 유지
      B 자외선지수지수 (물리 단위 없음)0.00.02105980.02105980/4다른 회차 유지
      B 강수확률퍼센트포인트 (%p)0.00.0332880.0332880/4다른 회차 유지
      B 강우확률퍼센트포인트 (%p)0.0000/4다른 회차 유지
      B 강설확률퍼센트포인트 (%p)0.00.02038040.02038040/4다른 회차 유지
      B 결빙확률퍼센트포인트 (%p)0.0000/4다른 회차 유지
      B 총 강수량 (물환산)mm0.0000/4다른 회차 유지
      B 강우량mm0.0000/4다른 회차 유지
      B 강설량mm0.0000/4다른 회차 유지
      B 착빙량mm0.0000/4다른 회차 유지
      B 운량퍼센트포인트 (%p)0.05.737775.737770/4다른 회차 유지
      반복 숫자와 이상값에 대한 처리 의견

      아래는 D12C에서 기록한 판단 근거입니다. 이후 사용자의 승인에 따라 D15 별도 정제본에 위와 같이 적용했습니다. 대회에서 의도적으로 오류를 넣었다는 근거는 없습니다. 오류 원인을 몰라도 값의 사용 부적합성을 판단할 수 있지만, 정상값을 복구했다고 하려면 더 강한 근거가 필요합니다.

      화면의 고유값 목록에도 문제가 있었습니다. 서로 다른 저장값을 소수 넷째 자리로 반올림해 같은 숫자처럼 표시했습니다. 목록은 이제 저장값을 구별할 수 있게 표시합니다. 마지막 자릿수의 차이는 부동소수점 연산으로 생길 수도 있으며 계측 정밀도와 다릅니다.

      패턴현재 판단권하는 처리와 복구 조건
      B 실측 운량 9,144 / 7,315.2 등 433건운량으로 사용 부적합. 운고 단위 수치와 일치하지만 원인 미확정파생 정제본에서 해당 운량을 결측으로 격리 권고. /100 또는 /1000 복구는 채택하지 않음. 원 필드 대응이 입증될 때만 재매핑
      A 실측 풍속 9999 및 같은 시각 극값 14건오류 가능성 매우 높음. 앞뒤 한 시간 최대 4.2057 m/s풍속 필드를 결측으로 격리 권고. 0풍으로 바꾸지 않음. 보간이나 예보 대체는 추정값이며 복구된 관측값이 아님
      B 실측 기압 0 hPa, 365건지상 기압으로 부적합기압 필드를 결측으로 격리 권고. 낮은 양의 기압 전체를 같은 규칙으로 지우지 않음
      같은 운량 이상 행의 큰 풍속·UV풍속 230건, UV 394건이 겹침. 열 대응 혼입을 의심할 근거해당 필드는 격리 우선. 범위 안에 든 다른 필드도 품질 표시 후 검토. 정상처럼 보인다는 이유만으로 행 전체를 신뢰하거나 일괄 삭제하지 않음
      A 예보 기온 / 최고기온 / 최저기온의 같은 수치fit에서 최고기온은 기온과 전 행 일치, 최저기온은 4개만 다름. README는 표 아래에서 세 값이 같다고 명시함. 기존 설명에서 그 문장을 누락했으며 최저기온 4건은 명세와 다른 예외로 보존값의 결측이 아니라 열 중복 문제로 판단. 현재 최고·최저 두 열은 입력에서 제외. 예외는 별도 보존
      B 기온 16.6667, 24.4444처럼 반복되는 소수README에 °F·mile·ft 환산이 명시돼 있고 수치 격자와 부합. 제공사/API 정체는 미확인반복 소수만으로 결측 처리하지 않음. 단위 환산과 시간 집계가 만든 수치 격자를 먼저 확인
      RH 101~104%, 시정 50 km 초과, 큰 체감온도기준 초과만으로 불가능하다고 할 수 없음. 과포화와 지표 정의를 구분원값과 품질 표시 유지. 체감온도를 기온의 상한으로 자르지 않음. 습도도 자동 100 제한하지 않음
      B 예보 습구온도와 기온·이슬점의 불일치현재 fit에서도 검토 후보: 기온+0.5°C 초과 2,788건, 이슬점−0.5°C 미만 599건. 중복 가능관련 값의 시각·정의·반올림을 대조. 어느 열이 틀렸는지 확정하기 전 임의 복구하지 않음
      동일 관측소·시각의 상충 중복fit 4개 키의 각 두 행이 상충양쪽 원행 보존. 출처 우선순위가 없으면 상충 필드를 결측으로 두는 후보. 단순 평균을 관측 정답으로 삼지 않음
      강수·강설의 0, 반복 분위수, 0/1 표시실제 0이 많으면 여러 분위수가 같을 수 있음정상 0 유지. 빈도나 중복만으로 결측 처리하지 않음

      앞뒤 시간으로 보면 복구 가능성이 달라집니다

      보존한 D12B 문맥을 다시 집계했습니다. A 극단 풍속 14건은 모두 1시간짜리 고립 구간이며 양옆 값이 검토 범위 안입니다. B 이상 운량 433건은 73개 관측소에서 연속 5~8시간 구간으로 나타났습니다. 두 경우에 같은 보간 규칙을 적용하지 않습니다.

      이상 구간연속 길이구간 수양옆 한 시간 모두 범위 안인 사례
      A 실측 극단 풍속1시간14개14 / 14건
      B 실측 이상 운량5시간 40개, 7시간 31개, 8시간 2개73개0 / 433건

      B 운량은 한쪽 이웃만 범위 안인 사례 146건, 양쪽 모두 이상인 사례 287건입니다. 범위 안이라는 조건도 정확한 관측임을 보증하지 않습니다. 짧은 고립 구간에는 제한 보간을 비교할 수 있지만, 긴 구간에서는 다른 가용 예보와 fit 통계 대체를 별도 비교해야 합니다. 현재 fit 예보의 실제 결측은 위 D13에서 별도로 측정했습니다. 과거 실측의 이상 구간과 혼합하지 않습니다.

      전날 17시까지 받은 예보는 앞뒤 목표 시간을 함께 참고할 수 있습니다. 그 뒤에 발생한 미래 실측으로 채우지는 않습니다. 원형 풍향, 급변하는 강수·운량, 완만한 기온·기압에 같은 보간식을 일괄 적용하지 않습니다. 복구 방법은 fit의 관측값을 실제 결측과 비슷한 길이로 가리는 검증에서 확인하고, 값 복원 오차와 모델 W를 구분합니다.

      결측 대체는 시간 이웃과 유사 사례를 함께 비교합니다

      시간상 가까운 같은 관측소·회차의 예보를 쓰는 방법과, 다른 시점의 비슷한 기온·습도·태양고도·계절·선행시간 조건을 찾는 KNN/유사 날 대체를 모두 후보로 둡니다. 필요하면 다른 변수로 추정하는 제한 다변량 대체를 추가합니다. D14의 제한된 fit 순방향 비교와 D15의 군집/KNN 보정, D16의 변수별 혼합 비교는 완료했습니다. P10 발전량 모델 평가도 완료했으며 결과는 위 별도 패널에 있습니다. 다변량 회귀 대체는 미실행입니다.

      같은 예보가 여러 발전소에 복제된 행은 하나의 원 예보로 묶습니다. ID 번호의 크기는 거리로 쓰지 않으며, 채우려는 값과 그 값의 파생열은 유사도 계산에서 제외합니다. 실제 결측과 비슷한 길이의 블록을 fit 내부 순방향 구간에서 가려 비교하고, 이웃이 부족한 경우와 대체값의 불확실성도 기록합니다. KNN·다변량 결측 대체의 공식 설명.

      원값, 품질 사유, 정제 후 값과 대체값의 출처를 별도로 보존합니다. 특히 이상이 집중된 과거 실측 기상은 현재 모델 입력에 미사용입니다. 이 정제 의견을 현재 모델 성능 개선으로 세지 않습니다. NOAA 과포화 정의, NWS 품질관리 원칙.

      P09 변수별 전처리 감사

      무엇이 실제로 입력됐고, 무엇을 고치나

      전처리 감사 집계를 불러오는 중

      기존 모델은 시간·각도·비율·범주를 충분히 구분하지 않은 채 마지막에 같은 표준화를 적용했습니다. 연중 주기, 태양각과 풍속 벡터는 이미 파생되어 있었지만, 시각·원풍향·풍향 차이·ID와 극값 제한에는 수정할 부분이 있습니다. 기존 결과와 원자료는 보존하고 새 버전의 입력 경로로 분리합니다.

      좌표와 시간대: 모두 KST, 태양시는 별도

      경도가 다르면 같은 KST에서도 태양 위치가 달라집니다. 기존 계산도 경도 135° 기준 보정과 위도를 사용했습니다. 새 경로는 구간 시작·끝·중간점, UTC 시각, 예보 발행 시각과 예보 선행시간을 명시하고 윤년을 반영합니다. 국가나 시간대를 좌표만 보고 새로 추정하지 않습니다.

      상자: 가운데 50%, 굵은 선: 5~95%, 가는 선: 최소~최대, 주황 표식: 중앙값. 패널마다 단위와 축 범위가 다릅니다.

      선택 변수의 변환 전후 수치
      분위수가공 표 관측값통일 단위기존 모델 입력새 경로 값
      P09a: 변환 후 실제로 다시 측정한 149개 수치 분포

      위 패널은 기존 분위수 지점의 변환 예시이고, 아래는 변환을 마친 관측값의 재집계입니다. 로그·sin/cos·표준화 출력은 무차원입니다. 예를 들어 풍속을 m/s로 맞춘 후 로그를 취한 값에 다시 m/s를 붙이지 않습니다. 이 P09a 통계 작업에는 학습이 없었습니다. 이후 P09b 저장 계약과 P09c 세 실제 학습을 완료했으며 결과는 P09c 비교 패널에 있습니다.

      상자: 가운데 50%, 굵은 선: 5~95%, 가는 선: 최소~최대, 주황 표식: 중앙값. 빈도 히스토그램은 아닙니다.

      통계저장 수치

      시간의 원형 표현

      아래는 실제 발전소 행이 아닌 설명용 예시입니다. 날짜와 시간대는 따로 보존하고, 하루 안 위치만 원형으로 표현합니다.

      풍향의 경계와 범주 임베딩

      아래 각도 역시 설명용 예시입니다. 359°와 1°는 서로 가까운 방향입니다.

      기존 142개 특징 모델은 ID를 표준화한 숫자로 사용했습니다. P09b에서 one-hot과 무작위 초기화한 ID 임베딩의 CUDA 및 저장 계약을 확인했습니다. P09c에서 같은 149개 수치에 기존 ID 수치, one-hot, 임베딩을 연결한 세 모델을 실제 학습했습니다. 모두 대조보다 W가 높아 기존 모델을 유지합니다.

      범주 ID→fit 사전 / UNK→one-hot 또는 embedding→수치 분기와 결합

      ID 숫자의 크기는 유사도나 거리가 아닙니다. 시간 위치 임베딩과 ID 임베딩도 서로 다릅니다.

      142개 열의 처리 전수 보고

      변수의미단위기존 실제 입력 경로새 경로
      전처리 리서치와 해석 한계

      단위만 바꾸고 평균·표준편차도 함께 바꾸면 z 값은 같습니다. 반면 주기형 인코딩, 범주 분리와 극값 제한 제거는 입력 표현 자체를 바꿉니다. sin/cos 또는 로그 변환이 항상 성능을 높이는 것은 아니며 같은 선택 구간의 통제 비교가 필요합니다. A/B 강수 누적 구간과 풍향 관례는 미확인 상태로 유지합니다.

        142개 변수의 뜻과 단위

        변수 사전을 불러오는 중

        142개 특징을 이루는 10개 계열

        변수와 뜻계열과 형태단위와 근거가공, 결측과 모델 입력

        실제 값은 어느 범위에 있나

        fit 분포를 불러오는 중

        원 단위의 관측값을 비교합니다. 17시 예보의 기존 10시 대체는 포함하지만, 남은 자연 결측에 평균이나 중앙값을 넣기 전입니다. 모델과 같이 FP32로 변환한 값에서 정확한 분위수를 계산했습니다.

        파란 상자: 가운데 50% (25~75%)주황 실선: 중앙값초록 점선: 평균회색 막대: 5~95%, 양 끝 점: 최소와 최대

        선택 변수의 전체 수치와 저장 형식
        통계실측 값

        가로축은 선택한 변수의 최소~최대 원 단위입니다. 상자가 한쪽에 몰리면 꼬리가 길거나 값이 반복된 분포일 수 있습니다. 범위를 자동으로 잘라 숨기지 않으며 수치표에서 확인할 수 있습니다. 5% 분위수는 작은 값부터 정렬했을 때 5% 지점의 값입니다. 같은 값이 반복되면 그 값 이하의 비율은 5%보다 클 수 있습니다. 화면 숫자는 반올림하며 계산과 대체 통계에는 원래 정밀도를 보존합니다.

        해석 범위와 아직 알 수 없는 것

        2023년 6월~2025년 1월의 발전소별 시간 행에 같은 가중치를 줬습니다. 같은 관측소 예보가 여러 발전소에 반복될 수 있으므로 독립 표본 수가 아닙니다. 발전량 정답 분포, 원본 CSV의 dtype, 2월과 5월 분포는 이번 집계에 없습니다. 가공 Parquet의 float는 32비트 실수, int8/int16은 8/16비트 정수 저장을 뜻합니다.

        fit에서 상수인 20개 열은 B의 원래 17시 예보 결측 표시입니다. 이 구간에서 해당 결손이 없었다는 관찰이며 자동 변수 제거 근거로 삼지 않습니다. 중앙값이 평균과 다르다는 사실도 성능 우위를 뜻하지 않습니다. 실제 평균/중앙값/원 단위 0 비교 결과는 위 P08c 패널에 별도로 표시합니다.

        벡터 표현은 어디에 적용됐나

        대상현재 적용 여부실제 의미 / 다음 비교
        시간 위치 임베딩적용됨24개 시간 위치를 학습 가능한 벡터로 바꿉니다. 시간 순서를 모델에 알려 주며, H03F 선택 구조의 벡터 폭은 64입니다.
        수치 특징의 벡터 투영적용됨표준화된 142개 값과 142개 결측 표시를 연결한 284개 입력을 학습 가능한 선형 층으로 폭 32 또는 64의 벡터로 변환합니다.
        발전소 / 관측소 ID 임베딩실제 비교 완료기존 142개 특징 모델은 표준화한 숫자 코드입니다. P09b에서 one-hot과 ID별 8차원 학습 임베딩의 CUDA 전달 및 저장 복원을 확인했습니다. P09c에서 세 ID 표현의 학습과 종료 검토를 완료했습니다. 새 결과 세 개를 봄 순위에 추가했고 최저 W 대조는 유지합니다.
        외부 사전학습 임베딩사용 안 함현재 입력은 문장이 아닌 수치 예보입니다. 외부 가중치 없이 fit 구간에서 학습하는 표현과 복원 자기지도학습을 비교 대상으로 둡니다.

        벡터로 바꿨다는 사실만으로 성능 향상이 입증되지는 않습니다. ID 표현의 P09c 실제 비교는 완료됐으며 새 후보 모두 기존 대조보다 W가 높았습니다. 자기지도 사전학습은 아직 실행하지 않았습니다.

        결측 대체값과 숫자 0이 같은 뜻이 아닌 이유

        초기 모델의 순서는 17시 예보 누락 시 같은 목표의 10시 예보 사용 → 남은 결측에 fit 평균 적용 → 표준화 → 모델에서 자연 결측과 padding 위치를 다시 0으로 가림이었습니다. 대체 통계만 바꾸면 마지막 단계에서 차이가 사라지므로, P08a에서 새 경로의 대체값 전달과 저장 복구 계약 12개를 통과했습니다. 평균 대조군의 출력과 gradient 차이는 0이었습니다. 이후 P08c에서 평균·중앙값·원 단위 0, P10에서 시간·회차 혼합을 실제 학습 비교했으며 결과는 위 패널에 보존했습니다.

        설명용 가상 예: 기온의 fit 평균이 20°C, 표준편차가 5°C라고 가정합니다. 실제 데이터 행이나 측정 통계가 아닙니다.

        대체 방법원 단위 값표준화 뒤 값초기 H03F 경로의 결측 위치P08c에서 실제 비교한 입력 경로
        평균 대체20°C00 + 결측 표시 10 + 결측 표시 1
        원 단위 0 대체0°C−40 + 결측 표시 1−4 + 결측 표시 1
        중앙값 15°C 가정15°C−10 + 결측 표시 1−1 + 결측 표시 1

        관측된 0°C는 결측 표시가 0이므로 다른 입력입니다. 발전량 정답의 누락은 위 방법으로 채워 학습하지 않습니다.

        어느 특징에 결측이 있나

        전체 142개 특징 검색과 결측 건수
        특징결측 수전체 행결측률

        현재 r17은 대체 전 17시 예보가 없을 때 같은 목표 시각의 r10으로 대체된 열입니다. missing17은 대체 전 결측 표시이며, 그 값 1은 표시값이지 표시 열 자체의 결측이 아닙니다.

        28개 기상 변수의 대체 전후 건수
        기상 변수10시 결측대체 전 17시 결측10시로 대체둘 다 결측

        결측이 집중된 월과 시간

        결측 지도를 건너뛰고 수치표로 이동

        셀을 선택하면 결측 수와 전체 행 수가 표시됩니다.

        셀을 클릭하거나 키보드로 선택할 수 있습니다. 아래 표에서도 모든 480개 셀의 수치를 확인할 수 있습니다. 자정 0시는 우측닫힘 시간 구간의 끝이며 월은 발전일 기준입니다.

        선택 특징의 월 × 시간 전체 480개 수치
        선택 특징의 월별 수치

        대표 수치 특징의 상관관계

        각 변수 쌍에서 둘 다 관측된 값으로 계산한 Pearson r입니다. 결측을 0이나 평균으로 채워 계산하지 않았습니다. 대체 전 17시가 없을 때 이미 적용된 10시 대체는 포함됩니다. ID 숫자는 제외합니다.

        주황 −1옅은색 0파랑 +1회색: 상수 또는 표본 부족

        상관 행렬 다음 설명으로 이동

        상관은 특징 중요도나 인과효과가 아닙니다. 계절·시간·발전소가 섞인 집계이며 같은 관측소 예보도 중복됩니다. 이 히트맵만으로 변수를 삭제하거나 학습 성능 개선을 확정하지 않습니다.

        현재 처리와 다음 비교

        대상기존 모델과 완료 비교후속 상태와 다음 비교
        예보 수치의 결측같은 시각 17시→10시 대체를 유지. H03F는 fit 평균, P08c는 중앙값/원 단위 0을 실제 비교 완료.P08c와 P10의 완료 W는 위 표 참조. P09a 통계와 P09b 계약을 거쳐 P09c 유형별 입력 세 방법 비교 완료.
        모델 입력 연결기존 H03F 경로는 자연 결측을 표준화 0으로 가림. P08c 자식 경로는 대체값과 표시를 함께 전달.padding/자연 결측 분리, 평균 재현 차이 0과 실제 두 대체 학습 완료. P09b CUDA 계약과 P09c 실제 학습 세 개 및 종료 검토 완료. 다음 작업은 실시간 계획 참조.
        발전소·관측소 ID숫자 코드로 전달. 시간 위치 embedding과 별개.one-hot / 무작위 초기화한 작은 embedding. ID 결손은 unknown으로 구분하며 다른 ID의 최빈값으로 바꾸지 않음.
        일반 범주형먼저 실제 범주와 결측 유무를 식별. 현재 142개 입력은 수치화된 특징.범주가 존재하고 결측이 있을 때 missing 범주 / fit 최빈값을 비교. ordinal 의미가 없는 범주에 숫자 간 거리를 강요하지 않음.
        풍향과 주기풍속 벡터와 달력 sin/cos가 이미 있음.라운드 간 raw 각도 차이의 원형 처리. 359→1도를 −358 대신 +2로 표현하는 별도 후보.
        자기지도학습사전학습 실행 0건. 현재 Transformer는 지도학습.fit 안의 관측 예보 일부를 가리고 복원한 뒤 발전량 학습. 자연 결측은 복원 정답에서 제외하고 추가 학습 예산 대조군을 둠.
        이전 대회와 공개 연구에서 가져올 다음 가설

        1~5회 발표자료의 텍스트와 핵심 도표를 검토했습니다. 과거 대회 점수와 현재 DSC6 점수는 비교하지 않습니다. 아래는 적용 가설이며 새 학습 결과가 아닙니다.

        근거적용할 비교그대로 가져오지 않는 부분
        1회 전처리와 2회 CNN 탐색결측 대체와 인코딩을 실제 입력까지 확인하고, CNN의 kernel·깊이를 조건부 탐색임의 shuffle 검증, 도메인 의미가 다른 0 대체
        3회 검증과 앙상블마지막 앙상블 단계에서 시간 분할을 유지하고 단독 W와 평균 예측을 비교내부 점수만으로 복잡한 stacking을 승격
        5회 LSTM / TransformerStacked LSTM을 초기 계열 비교에 추가. 발전소 정적 정보와 하루 예보 분기 분리도 별도 비교타이어 공간 순서의 성적을 발전량 시계열 성적으로 일반화
        TFT 원 논문정적 특성, 발행된 미래 예보, 과거 실적의 가용성을 나눠 입력큰 전체 구조를 검증 없이 먼저 이식
        PatchTST 공식 구현fit 전용 예보 복원과 동일 추가 학습 예산 대조외부 가중치, 검증 입력 사용. 24시간 짧은 문맥에서 긴 patch 효과를 가정
        GEFCom2014 태양광 연구제공 기상 변수의 물리 의미와 시간 정렬, 잔차 다양성 점검확률 예측 점수를 현재 정산 W와 혼용, 누적 여부 미확인 차분
        Parquet SQL 조회원본 복제 없이 결측·시간 연결을 조회할 read-only view 후보. 기존 집계와 일치 및 비용 측정 먼저자연어 RAG나 외부 embedding 모델의 불필요한 도입, 속도 개선을 측정 전 확정

        원자료 감사, D15 정제와 D16 복원 비교, P08c/P10 실제 학습은 완료했습니다. P09c 유형별 입력 세 방법의 종료 검토도 완료했습니다. 다음은 LightGBM, CatBoost, 1D CNN을 우선 같은 봄 조건에서 비교하고 MLP, TCN, Stacked LSTM과 fit 자기지도학습을 이어갑니다. 현재까지의 겨울 성적만으로 모델 계열을 기각하지 않습니다. 앙상블과 seed 반복은 마지막 단계입니다.

        대체 통계와 인코딩 사전은 fit에서만 학습해 고정합니다. 누락된 발전량 정답을 만들어 채우지 않습니다. 전처리, 구조, 자기지도학습과 학습 조합을 고른 뒤 앙상블과 seed 반복을 마지막에 비교합니다.

        어느 시간에 정산 오차가 쌓이는가

        E02 / 참조 배분

        실제 정산 페널티 W를 월과 시간대별로 합산했습니다. 색이 진할수록 금액이 큽니다. 1월과 2월에 같은 색 눈금을 적용합니다.

        각 열은 우측닫힘 구간의 끝 시각입니다. 24시는 23~24시이며 노란 밑줄은 k=3인 11~15시입니다. 관측 기여도는 원인이나 해당 시간을 제거했을 때의 개선량을 뜻하지 않습니다.

        데이터 진단

        전처리와 오류 구조부터 확인

        아래 기여도는 L1 모델의 2025년 2월 개발 검증과 참조 배분 기준입니다. 서로 겹치는 분류이므로 비율을 합산하지 않습니다. 원인이나 제거 효과를 뜻하지 않습니다.

        예보 불일치와 집합 편향

        같은 동결 모델의 1월과 2월 진단입니다. 2월은 이미 탐색한 개발 검증 구간이며 인과 효과나 독립 성능 검증이 아닙니다.

        예보 차이에 따른 오차

        2025년 1월2025년 2월

        행 수와 정산 기여 보기
        월 / 차이발전소-시간정규화 MAEW 기여

        두 원 예보가 있는 행만 수치 구간에 포함합니다. W 기여는 오차 상쇄를 반영한 회계적 분해이며 음수도 가능합니다. 구간을 제거했을 때의 개선량이 아닙니다.

        그룹별 시간대 편향

        2025년 1월2025년 2월

        (예측 − 실적) / 그룹 설비용량. 양수는 과대 예측입니다. 각 시간대에 1월 31일, 2월 28일을 집계했습니다. 시각은 구간 끝입니다.

        A그룹 2월 15시는 평균이 음수지만 가격 가중 중앙값은 양수입니다. 평균을 빼는 보정이 절대오차 정산에 최적인 것은 아닙니다. 보정값을 적용하지 않았습니다.

        낮 0실적의 빈도와 지속성

        월낮 0실적전체 W 기여하루 전체 0

        낮은 태양고도 10도 초과입니다. 하루 전체 0은 낮 관측이 4시간 이상이고 모두 0인 발전소-일 수입니다. W 기여는 오차 상쇄를 반영하며 제거 효과가 아닙니다.

        2025년 1월2025년 2월

        같은 발전소와 같은 대상일 안에서 이어지는 0실적의 연속 구간 수입니다. 밤을 넘어 이어 붙이지 않습니다.

        눈 덮임, 설비 정지와 통신 문제는 원인이 미확정인 가설입니다. 실적을 삭제하거나 모델을 다시 학습하지 않았습니다.

        개선의 불확실성

        진단 준비 중

        평균 예측의 상쇄와 다음 달 결과

        2025년 1월2025년 2월

        기존 L1 모델 대비 W 변화율. 음수는 개선, 양수는 악화입니다. 기준은 17시 LightGBM, L1은 다중 예보 LightGBM, Cat은 CatBoost입니다.

        고정 평균2월 WL1 대비개선 일수

        쌍은 절반씩, 셋은 1/3씩인 네 조합을 분석 전에 고정했습니다. 2월 비율 튜닝이나 새 학습은 하지 않았고 기존 L1과 참조 배분을 유지합니다. 이미 탐색한 개발 구간이므로 독립 검증이 아닙니다.

        원자료 감사

        검증 이력입니다. 원본을 다시 읽지 않은 갱신은 새 무결성 검사로 간주하지 않습니다.

        월별 전체 관측 비율

        미관측 발전량을 0으로 채우지 않습니다. 눈, 음영, 고장으로 보이는 저출력도 실제 목표값일 수 있어 일괄 삭제하지 않습니다.

        학습과거 발전소 이력
        조기 종료12월 / 2월
        구성 학습1월 / 3월
        후속 검증2월 / 4월
        봉인 검증5월

        겨울과 봄의 시계열 분할입니다. 겨울 모델과 봄 H03D는 완료됐으며, 봄 선택 점수를 겨울 검증 순위와 섞지 않습니다. 여름의 253개소 완전 관측이 없어 연간 일반화는 확인되지 않았습니다.

        같은 검증 구간끼리 비교합니다. 단일 구간의 개선은 잠정 결과이며 자동 승격하지 않습니다.

        전체 실험 원장 보기
        실험상태 / 구간참조 배분 W탐색 배분 W판단

        기대, 실제 결과, 다음 결정

        보존한 상세 기록

        초기 시험과 완료된 진단은 여기에서 펼쳐 볼 수 있습니다. 현재 실행 순서는 위쪽 작업 현황을 확인하세요. 모든 실험 원장, 원래 곡선과 점수는 보존합니다.

        초기 GPU 연결 시험과 이전 모델의 개별 학습 곡선

        과거 개별 학습 곡선

        기존 겨울 모델

        발전소별 용량 정규화 MAE입니다. Valid는 12월 조기 종료 구간이며 2월 정산 W와 다릅니다. 모델마다 가중치가 달라 곡선 높이로 모델 순위를 정하지 않습니다.

        TrainValid점선: 선택 반복

        겨울 모델 비교, W 선택 진단과 처리량 측정

        완료한 겨울 모델의 학습 경로

        모두 같은 겨울 분할의 seed 17, FP32 실행입니다. 각 epoch 종료 시 eval 모드의 실측값만 표시하며 큰 점은 12월 Valid로 선택한 모델입니다. 낮은 발전소 L1이 더 좋은 집합 W를 보장하지 않습니다.

        T11 Transformer / 날짜 고정T13 Transformer / 날짜 순서 변경C01 dilated CNNH02A 최대 epoch 연장H02B patience 연장

        세로축은 각 그래프의 관측 범위로 확대하며 두 그래프의 축 범위가 다릅니다. 큰 점은 선택된 epoch입니다. H02A의 1~4 epoch와 H02B의 1~6 epoch는 부모 모델에서 이어받은 기록입니다. 새로 학습한 횟수와 누적 횟수는 아래에서 구분합니다.

        Train eval

        가로축 epoch / 세로축 가중 L1

        12월 Valid

        Train과 Valid는 서로 다른 세로축 눈금입니다.

        모든 실측 값과 선택 epoch 보기
        모델EpochTrain evalValid학습부 누적 경과Seed

        학습 best와 정산 best가 같은가?

        검토된 정산 비교를 불러옵니다.

        W는 2024년 12월 24일 15시부터 30일 17시까지 147시간, 약 6.1일의 원래 실적을 사용합니다. 기존 L1은 더 넓은 기간의 학습 적격 라벨 70,146개를 사용합니다. 기간과 라벨도 달라 손실함수 하나의 효과로 해석하지 않으며 모델을 자동 승격하지 않습니다.

        공통 253개소 정산 W

        가로축 epoch / 세로축 백만원, 낮을수록 좋음

        기존 선택용 가중 L1

        기존 기록과 대조. W와 눈금 및 모집단이 다름

        13개 epoch의 S, W와 절대오차 보기
        Epoch기존 L1S / 원W / 원절대오차 / kWh

        새 학습과 HPO는 없었습니다. 고정 참조 배분과 원래 라벨로 계산했으며 Decimal 독립 산술과 대조했습니다. 1월/2월 리더보드와 별도 진단입니다.

        같은 기간으로 맞춰도 선택이 다른가?

        검토된 같은 모집단 비교를 불러옵니다.

        비교 단계시간 범위사용 라벨선택 epoch

        A와 B는 기간, B와 C는 학습용 라벨 필터를 바꿉니다. C와 D는 같은 147시간의 같은 실적과 예측을 사용하고 그룹 합산만 바꿉니다. 발전소별 비용은 대회 W가 아닙니다. 상쇄액은 고정 참조 배분 안에서 일어난 회계적 차이이며 새 배분의 개선 실적이 아닙니다.

        13개 epoch의 같은 기간 비용과 상쇄액 보기
        EpochA / 전체 적격 L1B / 공통 적격 L1C / 공통 원래 L1C / 발전소 비용, 원D / 집합 W, 원그룹 내부 상쇄, 원

        실행 예산과 메모리 관측

        모델파라미터완료 / 상한 epoch종료 이유발전소-일 배치 / 누적감독 실행 전체자식 최고 RSSTorch 예약 VRAM

        전체 시간에는 입력 준비, 검사와 저장이 포함되며 학습부 누적 시간과 다릅니다. Torch 예약 VRAM은 드라이버와 다른 앱을 제외한 값입니다. 24 MiB라는 수치만으로 GPU 부족이나 활용률을 판단하지 않습니다.

        T11은 1 epoch가 best이고 이후 2회 미개선으로 종료했습니다. T13은 4 epoch 상한에 도달했고 마지막 epoch가 best입니다. 초기 T11/T13/C01은 AdamW, 학습률 0.0003, weight decay 0.01, patience 2입니다. H02B는 patience 6으로 연장했으며 Optuna로 최적화한 결과가 아닙니다.

        3~4 epoch 결과는 초기 비교입니다. epoch 수만으로 학습 부족을 단정하지 않고 optimizer step, 입력량, 곡선과 계절 성능을 함께 확인합니다.

        P07: A6000 배치별 처리량 측정

        검토된 실제 측정값을 불러옵니다.

        저장 모델발전소-일 배치발전소-일 / 초3회 측정 범위배치 8 대비Torch 예약 VRAM

        같은 64개 표본, FP32, worker 0, 학습률 0으로 forward/backward와 optimizer 호출 시간을 비교했습니다. 모든 가중치를 유지했고 측정용 pt는 별도 보존했습니다. 동기화한 실행 시간에는 Python과 검사 비용도 포함됩니다. 전체 epoch 속도, 수렴 또는 정산 W 개선을 측정한 결과가 아닙니다. 실제 학습은 유효 배치와 update 수까지 맞춘 대조가 필요합니다.

        계열별 후보와 초기 구현 검토 이력

        너비 탐색 계획

        여러 방법을 선별한 뒤 깊이 검증

        계획은 실행 완료와 구분합니다. 각 계열의 소수 후보를 같은 시계열 검증으로 비교하고, 무거운 연산은 순차 큐 하나로 처리합니다.

        계열별 비교 계획

        가설별 배경과 제한
        완료한 계획과 팀 자료 검토

        완료한 비교 계획

        현재 순서는 위쪽 작업 현황 참조

        아래는 완료한 계획의 보존 기록입니다. 앞으로 비교할 후보와 순서는 위쪽 현재 작업 영역에서 확인할 수 있습니다.

        팀 자료에서 확인한 장점과 우리 적용 범위

        초기 준비 체크리스트

        체크리스트

        이전 자원 표본과 운영 기록

        실행 환경

        HeXA와 공유

        자원 측정 시각 확인 중

        Windows 여유 RAM 24 GiB와 커밋 여유 20%를 모두 검사합니다. 임계값 초과 시 이 연구의 작업만 안전하게 중단합니다. 감시만으로 호스트 재부팅 방지를 보장할 수는 없습니다.

        운영 기록

          어디까지 검증됐는가

          기간 / 모집단 / 반복 구분
          검증 항목현재 상태범위해석의 한계

          논문과 코드

          방법 참고 / 외부 학습 데이터 사용 금지