18 câu hỏi0s
1
Glue Data Catalog lưu trữ gì?
2
Crawler phát hiện partition từ đâu khi crawl S3?
3
Bucket rất lớn, mỗi ngày chỉ vài trăm object mới rải rác. Cách cập nhật catalog rẻ và nhanh nhất?
4
File log có format text tùy biến mà built-in classifier không nhận. Giải pháp?
5
Glue Schema Registry dùng để làm gì?
6
Job bookmark bật nhưng job vẫn xử lý lại toàn bộ dữ liệu mỗi lần chạy. Nguyên nhân phổ biến nhất?
7
Task nhẹ chỉ gọi API và ghi 1 file nhỏ, chạy hàng giờ. Loại Glue job tiết kiệm nhất?
8
Batch job hàng đêm không có SLA. Cách giảm chi phí Glue trực tiếp nhất?
9
Doanh nghiệp muốn data analyst (không biết code) tự làm sạch và chuẩn hóa dữ liệu qua giao diện. Dịch vụ nào?
10
Migrate database production với downtime tối thiểu. Loại DMS task?
11
Migrate Oracle → Aurora PostgreSQL. Công cụ chuyển đổi schema và stored procedures?
12
DMS ghi CDC vào S3, file chứa cột "Op" với giá trị I/U/D. Downstream cần làm gì để có trạng thái mới nhất của mỗi bản ghi?
13
Cần dữ liệu Aurora MySQL xuất hiện trong Redshift sau vài giây cho BI, không muốn vận hành pipeline. Giải pháp "least operational overhead"?
14
Đồng bộ hàng đêm 20TB từ NFS on-prem vào S3, chỉ chuyển phần thay đổi, có checksum verification. Dịch vụ nào?
15
Đối tác bên ngoài cần đẩy file qua giao thức SFTP vào data lake. Giải pháp managed?
16
Migrate 800TB, băng thông chỉ 200 Mbps, deadline 6 tuần. Giải pháp?
17
Kéo dữ liệu Salesforce vào S3 mỗi giờ, dạng Parquet, không viết code. Giải pháp?
18
Chọn nhiều đáp án
Nạp batch lớn từ S3 vào Redshift — cách đúng? (Chọn 2)