|
|
4 weeks ago | |
|---|---|---|
| .. | ||
| README.md | 4 weeks ago | |
| assignment.md | 7 months ago | |
README.md
데이터 정의하기
![]() |
|---|
| 데이터 정의하기 - @nitya 의 스케치노트 |
데이터는 발견을 하고 정보에 입각한 결정을 지원하기 위해 사용되는 사실, 정보, 관찰 및 측정치입니다. 데이터 포인트는 데이터 집합 내의 단일 데이터 단위이며, 데이터 집합은 데이터 포인트들의 모음입니다. 데이터 집합은 다양한 형식과 구조로 제공될 수 있으며, 보통 데이터가 어디서 왔는가 즉, 출처에 따라 달라집니다. 예를 들어, 회사의 월간 수익은 스프레드시트에 있을 수 있지만, 스마트워치에서 측정한 시간별 심박수 데이터는 JSON 형식일 수 있습니다. 데이터 과학자들이 데이터 집합 내에서 다양한 유형의 데이터를 다루는 것은 흔한 일입니다.
이 수업은 데이터의 특성과 출처별로 데이터를 식별하고 분류하는 데 중점을 둡니다.
사전 강의 퀴즈
데이터가 설명되는 방식
원시 데이터
원시 데이터는 출처에서 처음 받은 상태로, 분석되거나 정리되지 않은 데이터입니다. 데이터 집합에서 무슨 일이 일어나고 있는지 이해하려면, 이를 사람이 이해할 수 있고 추가 분석에 사용하는 기술도 이해할 수 있는 형식으로 조직할 필요가 있습니다. 데이터 집합의 구조는 어떻게 조직되는지를 설명하며, 구조화된, 비구조화된, 준구조화된 것으로 분류할 수 있습니다. 이 구조 유형은 출처에 따라 다르지만 궁극적으로 이 세 가지 범주에 들어갑니다.
정량적 데이터
정량적 데이터는 데이터 집합 내의 수치적 관찰로, 일반적으로 분석, 측정 및 수학적으로 사용될 수 있습니다. 정량적 데이터의 예로는 한 국가의 인구, 개인의 키, 회사의 분기별 수익 등이 있습니다. 추가 분석을 통해 정량적 데이터는 대기질 지수(AQI)의 계절별 추세를 발견하거나 평일 출근 시간 트래픽 확률을 추정하는 데 사용될 수 있습니다.
정성적 데이터
정성적 데이터, 즉 범주형 데이터는 정량적 데이터 관찰처럼 객관적으로 측정할 수 없는 데이터입니다. 이는 보통 제품이나 프로세스의 품질과 같은 무언가의 특성을 포착하는 다양한 주관적 데이터 형식입니다. 때때로 정성적 데이터는 수치적일 수 있으나 일반적으로 수학적으로 사용되지는 않습니다. 예를 들어 전화번호나 타임스탬프가 있습니다. 정성적 데이터의 예로는 동영상 댓글, 자동차 제조사와 모델, 가장 친한 친구의 좋아하는 색깔 등이 있습니다. 정성적 데이터는 소비자가 가장 좋아하는 제품을 이해하거나 구직 이력서에서 인기 키워드를 식별하는 데 사용할 수 있습니다.
구조화된 데이터
구조화된 데이터는 행과 열로 조직된 데이터로, 각각의 행이 동일한 열 집합을 가집니다. 열은 특정 유형의 값을 나타내며, 해당 값이 무엇을 의미하는지 설명하는 이름으로 식별됩니다. 행은 실제 값을 포함합니다. 열에는 종종 값들이 해당 열을 정확히 나타내도록 하기 위한 특정 규칙이나 제한이 있습니다. 예를 들어, 고객 명부 스프레드시트에서 각 행에는 반드시 전화번호가 있어야 하고, 전화번호에는 알파벳 문자가 포함되지 않아야 한다고 가정할 때, 전화번호 열에는 비어 있지 않고 숫자만 포함하는 규칙이 적용될 수 있습니다.
구조화된 데이터의 장점은 다른 구조화된 데이터와 관계를 맺을 수 있도록 조직될 수 있다는 점입니다. 그러나 데이터가 특정 방식으로 조직되도록 설계되었기 때문에 전체 구조를 변경하는 데는 많은 노력이 필요할 수 있습니다. 예를 들어, 고객 스프레드시트에 비어있으면 안 되는 이메일 열을 추가하면, 기존 데이터 집합 내 고객 행들에 새 값을 어떻게 추가할지 결정해야 합니다.
구조화된 데이터의 예: 스프레드시트, 관계형 데이터베이스, 전화번호, 은행 명세서
비구조화된 데이터
비구조화된 데이터는 일반적으로 행이나 열로 분류할 수 없고 따를 형식이나 규칙이 없습니다. 비구조화된 데이터는 구조화된 데이터에 비해 규제가 적어 새 정보를 추가하기가 더 쉽습니다. 예를 들어, 2분마다 대기압을 측정하는 센서가 온도를 측정하고 기록할 수 있도록 업데이트를 받았을 때, 비구조화 데이터라면 기존 데이터를 변경하지 않고도 온도 정보를 추가할 수 있습니다. 하지만 이런 경우 데이터를 분석하거나 조사하는 데 시간이 더 걸릴 수 있습니다. 예를 들어, 과학자가 센서 데이터로 지난달 평균 온도를 찾으려 했으나, 일부 기록에서 센서가 고장났음을 표시하기 위해 실제 숫자 대신 "e"라는 값을 기록해 데이터가 불완전하다는 사실을 발견하는 경우가 그렇습니다.
비구조화된 데이터의 예: 텍스트 파일, 문자 메시지, 동영상 파일
준구조화 데이터
준구조화 데이터는 구조화된 데이터와 비구조화된 데이터의 특징을 조합한 것입니다. 일반적으로 행과 열 형식을 따르지 않지만, 구조화된 것으로 간주되는 방식으로 조직되며 고정 형식 또는 규칙 집합을 따를 수 있습니다. 구조는 출처에 따라 달라지며, 명확한 계층 구조부터 새로운 정보를 쉽게 통합할 수 있는 더 유연한 형태까지 다양합니다. 메타데이터는 데이터가 어떻게 조직되고 저장되는지를 결정하는 데 도움을 주는 지표이며, 데이터 유형에 따라 다양한 이름을 가집니다. 일반적인 메타데이터 이름으로는 태그, 요소, 엔티티, 속성 등이 있습니다. 예를 들어, 일반적인 이메일 메시지는 제목, 본문, 수신자 집합을 가지고 있으며, 누가 언제 보냈는지에 따라 정리할 수 있습니다.
준구조화 데이터의 예: HTML, CSV 파일, JavaScript Object Notation (JSON)
데이터 출처
데이터 출처는 데이터가 생성된 최초 위치, 즉 데이터가 "존재하는" 곳이며, 데이터가 수집된 방식과 시기에 따라 달라집니다. 사용자가 생성한 데이터는 1차 데이터(primary data)라 하며, 일반적인 사용을 위해 데이터가 수집된 출처의 데이터는 2차 데이터(secondary data)로 간주됩니다. 예를 들어, 한 무리의 과학자들이 열대 우림에서 관찰한 데이터를 수집한다면 1차 데이터로 간주되며, 이 데이터를 다른 과학자들과 공유한다면 이를 사용하는 사람들에게는 2차 데이터가 됩니다.
데이터베이스는 흔한 출처이며, 데이터베이스 관리 시스템을 사용해 데이터를 호스팅하고 관리하며, 사용자는 쿼리라는 명령어로 데이터를 탐색합니다. 데이터 출처로서의 파일은 오디오, 이미지, 비디오 파일과 Excel과 같은 스프레드시트가 있습니다. 인터넷 출처는 데이터베이스와 파일 모두를 호스팅하는 일반적인 장소입니다. 응용 프로그래밍 인터페이스(API)는 인터넷을 통해 외부 사용자와 데이터를 공유할 수 있게 해주며, 웹 스크래핑은 웹 페이지에서 데이터를 추출하는 과정입니다. 데이터 다루기 수업은 다양한 데이터 출처를 활용하는 방법에 중점을 둡니다.
결론
이번 수업에서 배운 내용:
- 데이터가 무엇인지
- 데이터가 어떻게 설명되는지
- 데이터가 어떻게 분류되고 범주화되는지
- 데이터가 어디에서 발견될 수 있는지
🚀 도전 과제
Kaggle은 공개 데이터셋의 훌륭한 출처입니다. 데이터셋 검색 도구를 사용해 흥미로운 데이터셋을 찾아보고, 다음 기준으로 3-5개의 데이터셋을 분류해 보세요:
- 데이터가 정량적인지 정성적인지?
- 데이터가 구조화된, 비구조화된, 준구조화된 중 무엇인지?
강의 후 퀴즈
복습 및 자기주도 학습
- 이 Microsoft Learn 단원, 데이터 형식 식별하기에서는 구조화된, 준구조화된, 비구조화된 데이터에 대한 자세한 분류를 제공합니다.
과제
면책 조항: 이 문서는 AI 번역 서비스 Co-op Translator를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
