30 câu hỏi0s
1
Công ty nhận file JSON clickstream qua Kinesis Data Streams, cần lưu vào S3 dạng Parquet, partition theo ngày, ít vận hành nhất. Giải pháp?
2
Glue job nightly bật bookmark nhưng mỗi lần chạy vẫn xử lý lại toàn bộ dữ liệu. Nguyên nhân khả dĩ nhất?
3
Migrate database Oracle on-prem sang Aurora PostgreSQL với downtime tối thiểu. Bộ công cụ đúng?
4
Producer Kinesis bị ProvisionedThroughputExceededException dù tổng traffic thấp hơn tổng capacity các shard. Xử lý gốc rễ?
5
Team phân tích cần chạy SQL ad-hoc vài lần mỗi tuần trên 50TB Parquet trong S3, không muốn hạ tầng. Giải pháp cost-effective?
6
Bảng fact Redshift join thường xuyên với dim_store theo store_id; dim_calendar 5,000 dòng join với mọi bảng. Thiết kế distribution đúng?
7
Chọn nhiều đáp án
Pipeline SQS → Lambda: message hỏng khiến batch retry vô hạn. Hai cấu hình khắc phục? (Chọn 2)
8
Cần phát hiện PII (email, số thẻ) trong toàn bộ data lake S3 và cảnh báo tự động. Dịch vụ?
9
Kho Kafka self-managed trên EC2 muốn giảm vận hành, giữ nguyên code producer/consumer, không muốn quản lý capacity. Giải pháp?
10
Analyst mỗi nước chỉ được thấy row nước mình và không thấy cột lương khi query qua Athena. Giải pháp quản lý tập trung?
11
Job Spark đọc một file CSV nén GZIP 30GB chạy trên 20 worker nhưng chỉ 1 worker hoạt động. Nguyên nhân?
12
Dashboard Redshift chậm vào giờ cao điểm do hàng trăm query đồng thời; ngoài giờ cluster rảnh. Giải pháp không resize vĩnh viễn?
13
Workflow: chạy Glue job 2 giờ → nếu DQ pass chạy tiếp 2 job song song → alert khi fail. Orchestrator phù hợp?
14
Cần đồng bộ hàng đêm 30TB từ NFS on-prem lên S3, incremental, có verify checksum. Dịch vụ?
15
DynamoDB: cần phân tích phức tạp (join, aggregate) toàn bộ bảng bằng SQL hằng ngày mà không ảnh hưởng RCU production. Giải pháp?
16
Chọn nhiều đáp án
Firehose ghi S3 tạo hàng trăm nghìn file nhỏ khiến Athena chậm. Hai biện pháp? (Chọn 2)
17
Tính "tổng giao dịch 10 phút gần nhất, cập nhật mỗi 1 phút" trên stream với trạng thái được checkpoint. Công cụ?
18
Yêu cầu mã hóa S3: audit từng lần giải mã theo key, kiểm soát key policy, chia sẻ cross-account. Chọn gì?
19
Nạp 5TB CSV từ S3 vào Redshift nhanh nhất. Cách đúng?
20
Salesforce data cần về S3 mỗi giờ (incremental), có masking field nhạy cảm, không viết code. Dịch vụ?
21
Hàng trăm bảng và hàng chục team; quyền phải tự áp cho bảng mới theo phân loại (domain, độ nhạy). Cơ chế?
22
Glue job trong private subnet phải đọc S3, chi phí NAT gateway đang rất cao. Giải pháp?
23
Chọn nhiều đáp án
Chạy lại (backfill) dữ liệu ngày 2026-06-01 sau khi sửa bug transform. Điều kiện thiết kế cho phép làm an toàn? (Chọn 2)
24
Ứng dụng cần đọc stream Kinesis với 5 consumer độc lập, mỗi consumer đủ 2MB/s/shard, latency thấp. Tính năng?
25
Cần "một câu SQL" cập nhật bảng trên S3 (UPDATE/DELETE/MERGE) với ACID qua Athena. Bảng phải ở định dạng nào?
26
Mật khẩu Redshift cho ứng dụng phải rotate tự động và không xuất hiện trong code. Giải pháp?
27
Chi phí CloudWatch Logs của các Glue job tăng không kiểm soát. Nguyên nhân/giải pháp phổ biến?
28
Pipeline cần bảo đảm file từ đối tác được xử lý đúng một lần dù S3 event có thể gửi trùng. Kỹ thuật?
29
Cần theo dõi việc ai grant/revoke quyền Lake Formation và ai đã query bảng nhạy cảm. Nguồn audit?
30
Kho dữ liệu 5 năm: 6 tháng gần truy vấn dày trong Redshift, phần cũ hiếm dùng. Kiến trúc cost-effective mà vẫn JOIN được?