Unstructured data는 미리 정의된 스키마가 없으며 행과 열에 자연스럽게 맞지 않습니다. 예로는 PDF, 이메일(원시 텍스트), 이미지, 오디오, 비디오, 소셜 미디어 게시물 등이 있습니다. AI/ML 또는 파싱을 통해 구조를 추출할 수는 있지만, 데이터 자체가 예시처럼 일관된 표 형식으로 저장되지는 않습니다.
Semi-structured data는 어느 정도의 조직(키/태그/메타데이터)은 있지만 모든 레코드에 걸쳐 엄격하고 고정된 스키마를 강제하지는 않습니다. 일반적인 예로 JSON, XML, YAML, 로그 파일(이벤트 유형에 따라 필드가 달라질 수 있음)이 있습니다. 제시된 데이터셋은 모든 행에 대해 고정된 열 집합을 보여주므로 semi-structured가 아니라 structured data에 해당합니다.
Document는 일반적으로 document database(예: Azure Cosmos DB for NoSQL)에 저장되는 자체 포함형 데이터 객체(대개 JSON)를 의미합니다. 단일 행을 document로 표현할 수는 있지만, 문제의 표 형식 표현과 일관된 열 구조는 DP-900에서 강조하는 document 데이터 모델이 아니라 관계형 structured data의 특징입니다.
Structured data는 미리 정의된 스키마로 구성되며, 일반적으로 행과 열로 이루어진 테이블 형태로 표현됩니다. 이 예시는 각 레코드에 대해 일관된 필드(ID, First name, Last name, Email)를 가지므로 SQL 쿼리, 제약 조건, 인덱싱이 가능합니다. 이는 관계형 데이터베이스와 표 형식 데이터셋에서 사용하는 structured data의 전형적인 정의입니다.