Databricks Certified Professional Data Engineer Exam (Databricks-Certified-Professional-Data-Engineer Korean Version) - Databricks-Certified-Professional-Data-Engineer Korean Exam Practice Test
Question 1
데이터 설계자는 외부 소스에서 Databricks Lakehouse로 데이터가 수집되면 테이블 액세스 제어를 활용하여 모든 프로덕션 테이블 및 뷰에 대한 권한을 관리하기로 결정했습니다.
핵심 엔지니어링 그룹에 운영 데이터베이스에 대한 대화형 쿼리 권한을 부여하기 위해 다음과 같은 로직이 실행되었습니다.
prod 데이터베이스에 대한 사용 권한을 eng에 부여합니다.
GRANT SELECT ON DATABASE prod TO eng;
eng 그룹에 부여된 권한이 이것뿐이고 이 사용자들이 워크스페이스 관리자가 아니라고 가정할 때, 이들의 권한을 설명하는 문장은 무엇일까요?
핵심 엔지니어링 그룹에 운영 데이터베이스에 대한 대화형 쿼리 권한을 부여하기 위해 다음과 같은 로직이 실행되었습니다.
prod 데이터베이스에 대한 사용 권한을 eng에 부여합니다.
GRANT SELECT ON DATABASE prod TO eng;
eng 그룹에 부여된 권한이 이것뿐이고 이 사용자들이 워크스페이스 관리자가 아니라고 가정할 때, 이들의 권한을 설명하는 문장은 무엇일까요?
Correct Answer: B
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 2
데이터 엔지니어가 Auto Loader를 사용하여 들어오는 JSON 데이터를 읽고 있습니다. 유효하지 않은 JSON 레코드를 격리하도록 Auto Loader를 구성했지만, 시간이 지남에 따라 형식이 올바른 JSON 레코드조차 격리되는 것을 발견했습니다.
다음은 코드 조각입니다.
df = (spark.readStream
.format( " cloudFiles " )
.option( " cloudFiles.format " , " json " )
.option( " badRecordsPath " , " /tmp/somewhere/badRecordsPath " )
.schema( " a int, b int " )
.load( " /Volumes/catalog/schema/raw_data/ " ))
데이터가 누락된 원인은 무엇입니까?
다음은 코드 조각입니다.
df = (spark.readStream
.format( " cloudFiles " )
.option( " cloudFiles.format " , " json " )
.option( " badRecordsPath " , " /tmp/somewhere/badRecordsPath " )
.schema( " a int, b int " )
.load( " /Volumes/catalog/schema/raw_data/ " ))
데이터가 누락된 원인은 무엇입니까?
Correct Answer: A
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 3
데이터 엔지니어 팀은 새로운 데이터 파이프라인으로 마이그레이션을 시작하기 전에 개발, 테스트 및 프로덕션 환경을 구성하고 있습니다. 팀은 코드 실행 결과로 생성되는 코드와 데이터 모두에 대한 광범위한 테스트가 필요하며, 가능한 한 실제 운영 환경과 유사한 데이터를 사용하여 개발 및 테스트를 진행하고자 합니다.
신입 데이터 엔지니어가 프로덕션 데이터를 개발 테스트 환경에 마운트하여 프로덕션 전 코드가 프로덕션 데이터를 대상으로 실행될 수 있도록 하자고 제안했습니다. 개발 환경에서는 모든 사용자가 관리자 권한을 가지고 있으므로, 해당 엔지니어는 팀을 위해 권한을 설정하고 데이터를 마운트하는 작업을 직접 수행하겠다고 했습니다.
다음 중 이 상황에 대한 최적의 방안을 나타내는 진술은 무엇입니까?
신입 데이터 엔지니어가 프로덕션 데이터를 개발 테스트 환경에 마운트하여 프로덕션 전 코드가 프로덕션 데이터를 대상으로 실행될 수 있도록 하자고 제안했습니다. 개발 환경에서는 모든 사용자가 관리자 권한을 가지고 있으므로, 해당 엔지니어는 팀을 위해 권한을 설정하고 데이터를 마운트하는 작업을 직접 수행하겠다고 했습니다.
다음 중 이 상황에 대한 최적의 방안을 나타내는 진술은 무엇입니까?
Correct Answer: A
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 4
플랫폼 팀에서 CI/CD를 지원하기 위해 Databricks Asset Bundles용 표준 템플릿을 개발 중입니다. 이 템플릿은 아티팩트, 워크스페이스 루트 경로 및 실행 ID에 대한 기본값을 지정해야 하며, "dev" 대상을 기본값으로 설정하고 특정 경로를 재정의할 수 있도록 허용해야 합니다.
팀은 이러한 요구 사항을 충족하기 위해 databricks.yml 파일을 어떻게 사용해야 할까요?
팀은 이러한 요구 사항을 충족하기 위해 databricks.yml 파일을 어떻게 사용해야 할까요?
Correct Answer: D
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 5
데이터 팀이 배치 데이터와 스트리밍 데이터를 모두 처리하는 추가 전용 Delta Lake 파이프라인을 구현하고 있습니다. 이들은 소스 데이터의 스키마 변경 사항이 파이프라인을 중단시키지 않고 자동으로 반영되도록 하려고 합니다.
팀은 Delta 테이블에 데이터를 기록할 때 어떤 구성을 사용해야 할까요?
팀은 Delta 테이블에 데이터를 기록할 때 어떤 구성을 사용해야 할까요?
Correct Answer: C
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 6
데이터 엔지니어링 팀은 세 가지 데이터 소스를 사용하는 시간이 오래 걸리는 데이터 수집 작업을 수행하고 있습니다. 각 노트북은 새 데이터를 로드하는 데 약 1시간이 소요됩니다. 어느 날, 노트북 업데이트로 인해 새로운 필수 구성 매개변수가 추가되면서 작업이 실패했습니다. 팀은 신속하게 문제를 해결하고 실패한 소스에서 최신 데이터를 로드해야 합니다.
팀은 어떤 조치를 취해야 할까요?
팀은 어떤 조치를 취해야 할까요?
Correct Answer: C
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 7
데이터 엔지니어링 팀의 한 구성원이 더 큰 데이터 파이프라인의 일부로 실행되도록 예약하려는 간단한 노트북 파일을 제출했습니다. 아래 제공된 명령어를 제시된 대로 실행하면 논리적으로 올바른 결과가 생성된다고 가정합니다.

노트북을 작업으로 예약하기 전에 어떤 명령어를 제거해야 할까요?

노트북을 작업으로 예약하기 전에 어떤 명령어를 제거해야 할까요?
Correct Answer: D
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 8
데이터 엔지니어링 팀은 다음 코드를 유지 관리합니다.

이 코드가 논리적으로 올바른 결과를 생성하고 원본 테이블의 데이터가 중복 제거 및 유효성 검사를 거쳤다고 가정할 때, 이 코드가 실행될 때 발생하는 상황을 설명하는 문장은 무엇입니까?

이 코드가 논리적으로 올바른 결과를 생성하고 원본 테이블의 데이터가 중복 제거 및 유효성 검사를 거쳤다고 가정할 때, 이 코드가 실행될 때 발생하는 상황을 설명하는 문장은 무엇입니까?
Correct Answer: D
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 9
신입 데이터 엔지니어가 silver_device_recordings라는 Lakehouse 테이블에 대한 로직을 구현하는 작업을 진행하고 있습니다.
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 필드를 기준으로 매우 선택적인 조인을 수행하는 데 사용될 것이며, 머신 러닝 팀에서도 관련 필드를 기준으로 필터링하는 데 활용될 것입니다. 총 15개의 필드가 필터링 및 조인 로직에 자주 사용될 것으로 예상됩니다.
데이터 엔지니어는 테이블 스키마를 선언하기 전에 이러한 중첩 필드를 처리하는 최적의 접근 방식을 결정하려고 합니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 필드를 기준으로 매우 선택적인 조인을 수행하는 데 사용될 것이며, 머신 러닝 팀에서도 관련 필드를 기준으로 필터링하는 데 활용될 것입니다. 총 15개의 필드가 필터링 및 조인 로직에 자주 사용될 것으로 예상됩니다.
데이터 엔지니어는 테이블 스키마를 선언하기 전에 이러한 중첩 필드를 처리하는 최적의 접근 방식을 결정하려고 합니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
Correct Answer: B
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 10
신입 데이터 엔지니어가 silver_device_recordings라는 Lakehouse 테이블에 대한 로직을 구현하는 작업을 진행하고 있습니다.
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 프로덕션 모니터링 대시보드와 프로덕션 모델을 구동하는 데 사용될 예정입니다. 현재 100개 필드 중 45개가 이러한 애플리케이션 중 하나 이상에서 사용되고 있습니다.
데이터 엔지니어는 데이터의 고도로 중첩된 구조와 수많은 필드를 고려하여 스키마 선언을 처리하는 최적의 접근 방식을 찾으려고 노력하고 있습니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 프로덕션 모니터링 대시보드와 프로덕션 모델을 구동하는 데 사용될 예정입니다. 현재 100개 필드 중 45개가 이러한 애플리케이션 중 하나 이상에서 사용되고 있습니다.
데이터 엔지니어는 데이터의 고도로 중첩된 구조와 수많은 필드를 고려하여 스키마 선언을 처리하는 최적의 접근 방식을 찾으려고 노력하고 있습니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
Correct Answer: E
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 11
데이터 엔지니어가 Databricks의 Lakeflow Declarative Pipelines(LDP)를 사용하여 고객 데이터를 수집하는 간단한 데이터 파이프라인을 구축하고 있습니다. 원시 고객 데이터는 클라우드 스토리지에 JSON 형식으로 저장되어 있습니다. 이 작업은 원시 JSON 데이터를 읽어 추가 처리를 위해 Delta 테이블에 쓰는 Lakeflow Declarative Pipelines를 생성하는 것입니다.
어떤 코드 조각이 원시 JSON 데이터를 올바르게 가져와 LDP를 사용하여 델타 테이블을 생성합니까?
어떤 코드 조각이 원시 JSON 데이터를 올바르게 가져와 LDP를 사용하여 델타 테이블을 생성합니까?
Correct Answer: B
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 12
Apache Kafka 프로듀서의 모든 레코드가 다음 스키마를 가진 단일 Delta Lake 테이블로 수집되고 있습니다.
키는 BINARY, 값은 BINARY, 토픽은 STRING, 파티션은 LONG, 오프셋은 LONG, 타임스탬프는 LONG 형식입니다. 수집되는 토픽은 총 5개이며, "등록" 토픽에만 개인 식별 정보(PII)가 포함되어 있습니다. 회사는 PII에 대한 접근을 제한하고자 하며, PII가 포함된 기록은 최초 수집 후 14일 동안만 보관하기를 원합니다. PII가 아닌 정보는 무기한으로 보관하고자 합니다.
다음 중 요구 사항을 충족하는 해결책은 무엇입니까?
키는 BINARY, 값은 BINARY, 토픽은 STRING, 파티션은 LONG, 오프셋은 LONG, 타임스탬프는 LONG 형식입니다. 수집되는 토픽은 총 5개이며, "등록" 토픽에만 개인 식별 정보(PII)가 포함되어 있습니다. 회사는 PII에 대한 접근을 제한하고자 하며, PII가 포함된 기록은 최초 수집 후 14일 동안만 보관하기를 원합니다. PII가 아닌 정보는 무기한으로 보관하고자 합니다.
다음 중 요구 사항을 충족하는 해결책은 무엇입니까?
Correct Answer: C
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 13
데이터 엔지니어는 Databricks 환경에서 YAML 파일 처리를 위해 PyYAML Python 패키지를 설치해야 합니다. 하지만 Databricks 워크스페이스는 인터넷에 직접 연결되어 있지 않아 PyPI에서 패키지를 다운로드할 수 없습니다. 엔지니어는 이미 필요한 PyYAML wheel(.whl) 파일을 자신의 노트북에 다운로드했습니다. 이 엔지니어는 로컬 wheel 파일을 사용하여 PyYAML 패키지를 설치하고, Databricks 워크스페이스에 새 클러스터가 생성될 때마다 자동으로 패키지가 사용되도록 하려고 합니다. 어떤 방법을 사용하는 것이 좋을까요?
Correct Answer: A
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).
Question 14
다음 중 pyspark.sql.functions.broadcast의 올바른 사용법을 설명하는 문장은 무엇입니까?
Correct Answer: A
Explanation: Only visible for Actualtests4sure members. You can sign-up / login (it's free).

