콘텐츠로 건너뛰기 메뉴로 건너뛰기 푸터로 건너뛰기
데이터를 불러오고 있습니다
데이터를 저장하고 있습니다
#농업

2025년 벼, 콩 병해충 발생 생체 정보

2025년 벼, 콩 병해충 발생 생체 정보 아이콘 이미지
  • 분야농축수산
  • 유형 텍스트
  • 생성 방식기타
구축년도 : 2025 갱신년월 : 2026-03 조회수 : 1,294 다운로드 : 15 용량 :

※ 내국인만 데이터 신청이 가능합니다.

  • 데이터 변경이력

    데이터 변경이력
    버전 일자 변경내용 비고
    1.0 2026-03-03 데이터 개방 데이터 최초 개방

    데이터 히스토리

    데이터 히스토리
    일자 변경내용 비고
    2026-03-03 산출물 공개 콘텐츠 최초 등록

    소개

    이 데이터셋은 2025년 수원·춘천·전주·밀양 4개 지역에서 채취한 벼·콩 시료의 RNA 시퀀싱(RNA-seq) 결과에, 동일 시기·지역의 기상·토양 정보와 NCPMS 병해충 발생 이력을 융합하여 구축한 농작물 생체정보 데이터이다. 각 샘플은 TPM으로 정규화된 유전자 발현량과 병해충별 발생 유무(one-hot 라벨)를 포함하며, 벼·콩의 전 생육 기간에 대한 불량환경·병해충 조기 예측 AI 모델의 학습·검증·테스트용으로 활용된다.

    구축목적

    이 데이터 구축의 목적은 벼·콩 생체정보와 기상·토양·병해충 이력 데이터를 융합하여, 농작물 생체정보 AI 기반 불량환경 조기 예측 시스템을 구현하는 데 필요한 학습·검증 데이터를 제공하는 데 있다. 이를 통해 재배 환경의 이상 징후를 조기에 탐지하고 병해충 발생 가능성을 미리 예측함으로써, 현장 농가와 연구기관의 방제·재배 관리 의사결정을 과학적으로 지원하는 것을 목표로 한다.
  • 데이터 구축 규모
    원천 데이터 총 1,636 건(벼 900 건, 콩 736건), 가공(라벨링)데이터 총 409 건 (벼 225 건, 콩 184 건)
     

    데이터 구축 규모 표
    데이터 종류 데이터 형태 데이터 규모 어노테이션 규모
    텍스트+숫자형 225 건 225 건
    텍스트+숫자형 184 건 184 건


    데이터 분포
    작물 분포: 벼, 콩
    병해충 분포: 깨씨무늬병, 끝동매미충, 도열병, 먹노린재, 멸강나방, 벼검은줄오갈병, 벼멸구, 벼물바구미, 벼잎굴파리, 벼잎벌레, 벼줄기굴파리, 세균성알마름병, 애멸구, 오갈병, 이삭누룩병, 이삭도열병, 이화명나방1화기, 이화명나방2화기, 잎집무늬마름병, 줄무늬마르병, 혹명나방, 흰등멸구, 흰잎마름병, 역병, 탄저병

  • 활용모델 구조
    ● AI 기반 농작물 불량환경 예측 모델은 인코더와 분류기의 구조로 구성되어 있으며 인코더의 경우 DeepSVDD의 아키텍쳐를 활용하며 분류기의 경우 XGBoost 계열 ML 모델을 활용한다.
    활용 모델 구조 이미지
    모델학습
    ● 병해충별 발생 비율이 상이하여 객관적 성능 평가를 위해 테스트셋 크기는 고정하여 성능을 평가. 
    ● 최적의 학습 효율을 위해 Training 과 Validation은 병해충 발생 비율에 따라 유기적으로 변동 될 수 있도록 데이터셋 분할 과정과 학습 과정을 설계.
     

    모델 학습 표
    구분 클래스 Training +Validation Test
    1 203 22
    2 162 22


    모델학습 전략
    ● 전체 샘플 대비 각 병해충의 발생 빈도는 높지 않다. 이러한 unbalanced 데이터를 기반으로 예측 모델을 학습하기 위해서는 데이터 분포에 대한 보정/보완이 필요하다.
    ● 데이터 비율의 불균형을 보완하기 위해 학습과정에서 Out-Of-Distribution (OOD)의 개념을 적용하여, 가상의 병해충 데이터를 생성하여 학습하게 된다. 이때 가상의 데이터는 실제 데이터의 분포를 기반으로 정상과 병해충을 구분하는 margin 근처에 위치하도록 생성된다.
    ● 인코더의 역할을 수행하는 DeepSVDD 인코더는 정상과 병해충을 구분하는 margin을 학습하게 되며 이렇게 형성된 Embedding space를 기반으로 OOD가 적용되고 실제 데이터와 생성 데이터를 함께 사용하여 이진 분류기 모델을 학습하게 된다.
    ● 이진 분류기는 여러 모델의 활용이 가능하나 본 사업에서는 XGBoost 계열의 모델이 Random Forest, SVM 모델보다 우수한 성능을 보여주어 최종 분류기로 선정하였다.

  • 설명서 및 활용가이드 다운로드

    데이터 설명서 다운로드 구축활용가이드 다운로드

    데이터 구성
    본 사업을 통해 구축된 데이터는 벼와 콩에 대한 생체정보를 중심으로 해당 정보가 수집된 일자와 지역에 대한 기상, 토양, 병해충발생이력 정보를 병합하여 최종 AI 학습 데이터로 활용함
     

    ● 생체정보: RNA-seq 데이터로 시료 채취 후 표준화된 프로토콜에 따라 각 샘플 내 유전자 발현량을 측정한 정보
    ● 기상정보: 공공 데이터베이스에서 수집된 각 지역의 기상 정보를 API를 기반으로 수집하여 실제 샘플이 채취된 일자의 일별 기상 정보를 정제
    ● 토양정보: 공공 데이터베이스에서 수집된 각 지역의 토양 정보를 API를 기반으로 수집하여 실제 샘플이 채취된 지역의 토양 정보만을 정제
    ● 병해충발생이력정보: 공공 데이터베이스에서 벼와 콩의 2023년, 2024년 병해충이력정보를 수집하여 각 샘플의 채취시기와 비교하여 발생이력정보를 정제

     

    어노테이션 포맷
    1. 벼 데이터 어노테이션 포맷

    어노테이션 포맷-1.벼 데이터 어노테이션 포맷
    No 속성명 타입 필수여부 속성 설명 예시
    1 sample_id string Y 시료 샘플 ID RDC250616
    2 location_code string Y 시료 채취 지역 코드 (H: 수원 화성, C: 춘천, J: 전주, M: 밀양) C
    3 sample_date string Y 시료 채취 날짜 2025-06-16
    4 report_date string N NCPMS 예찰 날짜 2025-06-16
    5 day_diff Num N sample_date 와 report_data 차이 4
    6 깨씨무늬병 Num Y 깨씨무늬병 발생 여부 0 or 1
    7 끝동매미충 Num Y 끝동매미충 발생 여부 0 or 1
    8 도열병 Num Y 도열병 발생 여부 0 or 1
    9 먹노린재 Num Y 먹노린재 발생 여부 0 or 1
    10 멸강나방 Num Y 멸강나방 발생 여부 0 or 1
    11 벼검은줄오갈병 Num Y 벼검은줄오갈병 발생 여부 0 or 1
    12 벼멸구 Num Y 벼멸구 발생 여부 0 or 1
    13 벼물바구미 Num Y 벼물바구미 발생 여부 0 or 1
    14 벼잎굴파리 Num Y 벼잎굴파리 발생 여부 0 or 1
    15 벼잎벌레 Num Y 벼잎벌레 발생 여부 0 or 1
    16 벼줄기굴파리 Num Y 벼줄기굴파리 발생 여부 0 or 1
    17 세균성알마름병 Num Y 세균성알마름병 발생 여부 0 or 1
    18 애멸구 Num Y 애멸구 발생 여부 0 or 1
    19 오갈병 Num Y 오갈병 발생 여부 0 or 1
    20 이삭누룩병 Num Y 이삭누룩병 발생 여부 0 or 1
    21 이삭도열병 Num Y 이삭도열병 발생 여부 0 or 1
    22 이화명나방1화기 Num Y 이화명나방1화기 발생 여부 0 or 1
    23 이화명나방2화기 Num Y 이화명나방2화기 발생 여부 0 or 1
    24 잎집무늬마름병 Num Y 잎집무늬마름병 발생 여부 0 or 1
    25 줄무늬마름병 Num Y 줄무늬마름병 발생 여부 0 or 1
    26 혹명나방 Num Y 혹명나방 발생 여부 0 or 1
    27 흰등멸구 Num Y 흰등멸구 발생 여부 0 or 1
    28 흰잎마름병 Num Y 흰잎마름병 발생 여부 0 or 1
    29 num_disease Num N 샘플별 병해충 발생 수 4

    2. 콩 데이터 어노테이션 포맷

    어노테이션 포맷-콩 데이터 어노테이션 포맷
    No 속성명 타입 필수여부 속성 설명 예시
    1 sample_id string Y 시료 샘플 ID RDC250616
    2 location_code string Y 시료 채취 지역 코드 (H: 수원 화성, C: 춘천, J: 전주, M: 밀양) C
    3 sample_date string Y 시료 채취 날짜 2025-06-16
    4 report_date string N NCPMS 예찰 날짜 2025-06-16
    5 day_diff Num N sample_date 와 report_data 차이 4
    6 역병 Num Y 역병 발생 여부 0 or 1
    7 탄저병 Num Y 탄저병 발생 여부 0 or 1
    8 num_disease Num N 샘플별 병해충 발생 수 4

    데이터 포맷

    파일 형식은 csv 파일로, 열은 샘플을 의미하며 행은 샘플이 기상정보, 토양정보, 생체정보를 의미함.
    벼의 경우 8 가지 기상정보, 7 가지 토양정보, 46 가지 병해충발생이력정보, 37,890 가지 유전자 발현 생체정보를 포함하며,
    콩의 경우 8 가지 기상정보, 7 가지 토양정보, 4 가지 병해충발생이력정보, 52,936 가지 유전자 발현 생체정보를 포함한다.

    실제 예시
    1. 데이터 예시
    실제 예시-데이터 예시 이미지
    2. 어노테이션 예시
    실제 예시-어노테이션 예시
     

  • 데이터셋 구축 담당자

    수행기관(주관) : 경기도농업기술원
    수행기관(주관)
    책임자명 전화번호 대표이메일 담당업무
    장정희 031-8008-9269 jjh7648@gg.go.kr 사업 담당
    수행기관(참여)
    수행기관(참여)
    기관명 담당업무
    나무ICT 사업 총괄
    NBiT 데이터 생산
    ㈜아이겐드럭 데이터 가공, AI 모델 개발
    데이터 관련 문의처
    데이터 관련 문의처
    담당자명 전화번호 이메일
    최범순 033-255-0416 bschoi@nbitglobal.com
    AI모델 관련 문의처
    AI모델 관련 문의처
    담당자명 전화번호 이메일
    조창연 070-4902-0716 changyuncho@aigendrug.com
보건의료 데이터 개방 안내

보건의료 데이터는 온라인 및 오프라인 안심존을 통해 개방됩니다.

안심존이란 안심존 이용메뉴얼 안심존 이용신청 데이터 열람신청
  • 인터넷과 물리적으로 분리된 온라인·오프라인 공간으로 의료 데이터를 포함하여 보안 조치가 요구되는 데이터를 다운로드 없이 접근하고 분석 가능
    * 온라인 안심존 : 보안이 보장된 온라인 네트워크를 통해 집, 연구실, 사무실 등 어디서나 접속하여 데이터에 접근하고 분석
    * 오프라인 안심존 : 추가적인 보안이 필요한 데이터를 대상으로 지정된 물리적 공간에서만 접속하여 데이터에 접근하고 분석

    1. AI 허브 접속
      신청자
    2. 안심존
      사용신청
      신청자신청서류 제출*
    3. 심사구축기관
    4. 승인구축기관
    5. 데이터 분석 활용신청자
    6. 분석모델반출신청자
  • 1. 기관생명윤리위원회(IRB) 심의 결과 통지서 [IRB 알아보기] [공용IRB 심의신청 가이드라인]
    2. 기관생명윤리위원회(IRB) 승인된 연구계획서
    3. 신청자 소속 증빙 서류 (재직증명서, 재학증명서, 근로계약서 등 택1)
    4. 안심존 이용 신청서 [다운로드]
    5. 보안서약서 [다운로드]
    ※ 상기 신청서 및 첨부 서류를 완비한 후 신청을 진행하셔야 정상적으로 절차가 이루어집니다.

  • 신청 및 이용관련 문의는 safezone1@aihub.kr 또는 02-525-7708, 7709로 문의

데이터셋 다운로드 승인이 완료 된 후 API 다운로드 서비스를 이용하실 수 있습니다.

API 다운로드 파일은 분할 압축되어 다운로드 됩니다. 분할 압축 해제를 위해서는 분할 압축 파일들의 병합이 필요하며 리눅스 명령어 사용이 필요합니다.

리눅스 OS 계열에서 다운로드 받으시길 권장하며 윈도우에서 파일 다운로드 시 wsl(리눅스용 윈도우 하위 시스템) 설치가 필요합니다.

※ 파일 병합 리눅스 명령어

find "폴더경로" -name "파일명.zip.part*" -print0 | sort -zt'.' -k2V | xargs -0 cat > "파일명.zip"

- 해당 명령어 실행 시, 실행 경로 위치에 병합 압축 파일이 생성됩니다.

- 병합된 파일 용량이 0일 경우, 제대로 병합이 되지 않은 상태이니 "폴더경로"가 제대로 입력되었는지 확인 부탁드립니다.

※ 데이터셋 소개 페이지에서 다운로드 버튼 클릭하여 승인이 필요합니다.

오프라인 데이터 이용 안내

본 데이터는 K-ICT 빅데이터센터에서도 이용하실 수 있습니다.

K-ICT 빅데이터센터는 데이터 안심구역으로 지정되어
다양한 데이터(미개방 데이터 포함)를 분석할 수 있는 오프라인 분석공간을 제공하고 있습니다.

데이터 안심구역 이용절차 및 신청은 K-ICT빅데이터센터 홈페이지를 참고하시기 바랍니다.

국방데이터 이용신청 탭 이미지

국방데이터 개방 안내

본 데이터는 국방데이터로 군사 보안에 따라 AI허브에서 데이터를 제공하지 않으며,
군 담당자를 통한 별도의 사용 신청이 필요합니다.

방송영상 데이터 개방 안내

방송영상 데이터는 열람서비스를 통해 개방됩니다.

안심존이란 안심존 이용메뉴얼 데이터 열람신청
  • 인터넷과 물리적으로 분리된 온라인·오프라인 공간으로 의료 데이터를 포함하여 보안 조치가 요구되는 데이터를 다운로드 없이 접근하고 분석 가능
    * 온라인 안심존 : 보안이 보장된 온라인 네트워크를 통해 집, 연구실, 사무실 등 어디서나 접속하여 데이터에 접근하고 분석
    * 오프라인 안심존 : 추가적인 보안이 필요한 데이터를 대상으로 지정된 물리적 공간에서만 접속하여 데이터에 접근하고 분석

    1. AI 허브 접속
      신청자
    2. 안심존
      사용신청
      신청자신청서류 제출*
    3. 심사구축기관
    4. 승인구축기관
    5. 데이터 분석 활용신청자
    6. 분석모델반출신청자
  • 1. 기관생명윤리위원회(IRB) 심의 결과 통지서 [IRB 알아보기] [공용IRB 심의신청 가이드라인]
    2. 기관생명윤리위원회(IRB) 승인된 연구계획서
    3. 신청자 소속 증빙 서류 (재직증명서, 재학증명서, 근로계약서 등 택1)
    4. 안심존 이용 신청서 [다운로드]
    5. 보안서약서 [다운로드]
    ※ 상기 신청서 및 첨부 서류를 완비한 후 신청을 진행하셔야 정상적으로 절차가 이루어집니다.

  • 신청 및 이용관련 문의는 safezone1@aihub.kr 또는 02-525-7708, 7709로 문의