18 câu hỏi0s
1
Lợi thế chính của DynamicFrame so với Spark DataFrame là:
2
JSON nested chứa mảng items cần nạp thành các bảng quan hệ phẳng vào Redshift. Transform Glue nào?
3
Job chỉ cần dữ liệu partition tháng này nhưng đang scan toàn bộ bảng rồi filter. Tối ưu đúng nhất?
4
Muốn partition mới do job ghi ra tự xuất hiện trong Data Catalog (không chạy crawler). Cách nào?
5
Stage có 1 task chạy lâu gấp 50 lần các task khác. Nguyên nhân?
6
Chọn nhiều đáp án
Job Spark đọc hàng triệu file nhỏ bị OOM ở driver. Giải pháp trực tiếp? (Chọn 2)
7
Trên EMR, node type nào phù hợp nhất cho Spot instances?
8
Nightly Spark batch 2h trên EMR, muốn không trả tiền lúc idle. Cấu hình?
9
Đội cần chạy Trino cho SQL ad-hoc tự quản cấu hình sâu. Dịch vụ nào chạy được Trino?
10
Giới hạn timeout tối đa của Lambda là:
11
Lambda xử lý file khi S3 upload, thỉnh thoảng gặp file rất lớn gây timeout. Kiến trúc đúng?
12
Chọn nhiều đáp án
Lambda đọc SQS, một message hỏng gây retry lặp cả batch. Cấu hình khắc phục? (Chọn 2)
13
S3 event có thể phát trùng. Cách đảm bảo Lambda không xử lý đôi?
14
Workflow ETL cần chờ Glue job chạy 4 giờ, có retry và nhánh lỗi. Chọn gì?
15
Công ty có sẵn hàng trăm Airflow DAGs muốn lên AWS ít công nhất. Giải pháp?
16
Xử lý song song 1 triệu object S3, kiểm soát concurrency, retry per item. Tính năng nào?
17
Khi Glue job FAILED cần tự động bắn SNS mà không sửa job. Giải pháp?
18
Pipeline CHỈ gồm crawler Glue → job Glue → job Glue, đơn giản, muốn ở trong Glue. Orchestrator?