데이터레이크 구축 비용 2026, S3·Glue·Athena 예산 산정 기준

데이터레이크 구축 비용을 찾는 팀은 대부분 저장소 단가만 보고 첫 예산을 잡는다.
하지만 실제 월 비용 명세는 S3 용량, 요청 수, Glue 작업 시간, Athena 스캔량, Lake Formation 권한 운영, 데이터 품질 보정 시간이 함께 움직인다.
이 글은 AWS 공식 가격표와 데이터레이크 설계 문서를 기준으로, 데이터 플랫폼 담당자가 첫해 예산안을 검토할 때 바로 볼 항목만 추렸다.
- 데이터레이크는 웨어하우스보다 저렴한 저장소를 쓰지만, 쿼리 스캔과 ETL 반복이 통제되지 않으면 월 비용이 빠르게 커진다.
- AWS S3 Standard의 US East 예시는 첫 50TB 구간 $0.023/GB-month이며, PUT/LIST와 GET 요청도 별도 과금된다.
- Athena SQL은 TB 스캔 기준 $5.00이 핵심이므로 Parquet, 압축, 파티션, Workgroup 한도가 비용 통제의 중심이다.
- Lake Formation 권한 자체는 no charge로 공개되어도 S3, Glue Data Catalog, Athena, CloudTrail 같은 통합 서비스 비용은 따로 계산해야 한다.
공식 가격표 핵심 숫자부터 본다
아래 표는 2026년 8월 28일 확인한 AWS 공식 가격표와 공개 가격 자료의 US East 예시를 데이터레이크 구축 비용 항목으로 다시 묶은 것이다.
서울 리전, 약정, 환율, 세금, 데이터 전송 조건은 달라질 수 있으므로 실제 계약 전에는 AWS Pricing Calculator로 다시 계산해야 한다.
| 비용 항목 | 공식 공개 숫자 | 데이터레이크에서 커지는 조건 | 예산 검토 질문 |
|---|---|---|---|
| S3 Standard 저장소 | $0.023/GB-month 첫 50TB, $0.022/GB-month 다음 450TB, $0.021/GB-month 500TB 초과 | raw와 curated zone을 모두 Standard에 오래 보관할 때 | 원본 보존 기간과 lifecycle 전환 기준이 정해졌는가 |
| S3 쓰기·목록 요청 | $0.005 per 1,000 PUT, COPY, POST, LIST requests | 작은 파일을 초 단위로 계속 적재하거나 파티션을 과도하게 나눌 때 | 파일 크기 목표와 배치 주기가 정해졌는가 |
| S3 읽기 요청 | $0.0004 per 1,000 GET and all other requests | BI, notebook, ETL 검증 작업이 같은 원본을 반복 조회할 때 | 서비스 계정별 읽기 패턴을 태그로 구분하는가 |
| Athena SQL 쿼리 | $5.00 per TB scanned, 10MB minimum per query | CSV 원본을 그대로 조회하거나 파티션 pruning이 실패할 때 | Workgroup scan limit와 쿼리 결과 저장소가 설정됐는가 |
| Athena Capacity Reservation | $0.30 per DPU-hour | 업무 시간 피크 동시 쿼리를 예약 용량으로 고정할 때 | 상시 예약보다 피크 시간만 예약하는 편이 싼가 |
| Athena Spark | $0.35 per DPU-hour | 노트북 기반 전처리와 탐색 작업을 길게 열어둘 때 | 개발 세션 자동 종료와 사용자별 비용 태그가 있는가 |
| AWS Glue ETL | 가격표 예시는 $0.44 per DPU-hour이며 Glue 6.0+ ETL은 $0.308, Flex는 $0.203 per DPU-hour 예시가 있다 | 매일 재처리, 대용량 join, crawler 반복, Iceberg compaction을 켤 때 | 작업별 DPU와 재시도 횟수가 견적서에 분리됐는가 |
| Glue Data Catalog | 1백만 metadata object까지 free, 초과분 $1.00 per 100,000 objects/month, 요청은 $1 per 1,000,000 requests | 테이블 버전, 파티션, 통계, 카탈로그가 빠르게 늘 때 | 파티션 수와 table version 보존 정책을 제한했는가 |
| Lake Formation 권한 | database, table, column, row, cell level permission과 cross-account sharing은 no charge | 권한은 무료라도 통합 서비스 사용량이 늘 때 | 권한 구조 변경 로그와 월별 권한 리뷰 담당자가 있는가 |
S3 가격표가 싼 저장소처럼 보이는 순간부터 비용 누락이 시작된다.
데이터레이크 구축 비용은 저장 단가가 아니라 저장한 데이터를 누가, 얼마나 자주, 어떤 형식으로 스캔하는지에 따라 달라진다.
데이터레이크 구축 비용은 다섯 계정으로 쪼갠다
첫째 계정은 저장소다.
raw, curated, serving zone을 나누면 같은 원본이 여러 형식으로 남기 때문에 단순 원본 TB보다 과금 기준 TB가 커진다.
둘째 계정은 수집과 변환이다.
Glue ETL, crawler, compaction, 통계 생성 작업은 실행 시간과 DPU가 곱해져서 월 비용으로 나온다.
셋째 계정은 쿼리와 분석이다.
Athena는 인프라를 미리 띄우지 않아도 되지만, 잘못 작성된 쿼리가 수십 TB를 반복 스캔하면 저장소 절감분을 바로 지운다.
넷째 계정은 권한과 감사다.
Lake Formation 권한 자체가 무료라도 IAM, CloudTrail, KMS, 로그 보존, 승인 프로세스는 운영비로 남는다.
다섯째 계정은 품질과 소유권이다.
중복 데이터, 깨진 스키마, 소유자 없는 테이블을 정리하는 시간이 없으면 데이터레이크가 곧 데이터 늪으로 바뀐다.
| 계정 | 대표 비용 | 통제하지 않으면 생기는 문제 | 초기 설계 기준 |
|---|---|---|---|
| 저장소 | S3 Standard, IA, Glacier, Tables, 결과 저장 버킷 | 원본과 가공본이 동시에 늘고 lifecycle이 늦어진다 | zone별 보존 기간과 전환 규칙을 문서화한다 |
| 수집·변환 | Glue job, crawler, compaction, scheduler | 실패 재시도와 전체 재처리로 DPU 시간이 늘어난다 | 증분 처리와 재처리 범위를 기본값으로 둔다 |
| 쿼리 | Athena TB scanned, DPU reservation, Spark session | BI 사용자가 원본 zone을 직접 스캔한다 | Workgroup, quota, query result bucket을 분리한다 |
| 권한·감사 | Lake Formation 정책 운영, IAM, CloudTrail, KMS | PII 컬럼이 과도하게 공개되고 감사 추적이 빈다 | column/row 권한과 승인 로그를 필수로 둔다 |
| 품질·운영 | 데이터 계약, 테스트, 소유자 관리, lineage | 테이블은 늘지만 믿을 수 있는 지표가 줄어든다 | 데이터 제품별 owner와 SLA를 만든다 |
이 글이 필요한 사람
- 데이터레이크 구축 비용을 S3 월 저장료만으로 산정해도 되는지 확인하려는 데이터 플랫폼 담당자.
- Snowflake나 Databricks 비용 최적화 전에 원천 데이터 저장과 쿼리 경로를 분리하려는 아키텍트.
- 로그, 클릭스트림, IoT, ERP 데이터를 한곳에 모으려는데 권한과 개인정보 통제가 걱정되는 보안팀.
- 데이터웨어하우스와 데이터레이크를 비교하면서 첫해 예산과 운영 인력을 같이 잡아야 하는 구매팀.
- Athena, Glue, Lake Formation을 이미 쓰지만 태그와 Workgroup 한도가 없어 월 비용 분석이 어려운 FinOps 담당자.
구축 순서는 저장소보다 소비 경로부터 정한다
데이터레이크 구축 비용을 줄이려면 저장소를 먼저 만들지 말고 소비 경로를 먼저 정해야 한다.
BI 보고서, 머신러닝 피처, 감사 로그 보존, 외부 파트너 공유는 파일 형식과 권한 구조가 서로 다르다.
- 1단계: 월별로 들어오는 데이터 소스, 예상 TB, 파일 수, 갱신 주기, 개인정보 포함 여부를 표로 만든다.
- 2단계: raw, curated, serving zone을 나누고 각 zone의 보존 기간, 암호화 키, 접근 주체를 정한다.
- 3단계: CSV나 JSON 원본을 바로 조회하지 말고 Parquet 또는 ORC 변환 대상을 먼저 고른다.
- 4단계: Athena Workgroup을 팀별로 만들고 쿼리당 스캔 한도, 결과 저장 버킷, 태그를 강제한다.
- 5단계: Glue job은 전체 재처리와 증분 처리 경로를 분리하고 DPU, 실행 시간, 재시도 횟수를 기록한다.
- 6단계: Lake Formation 권한은 raw zone 직접 접근을 막고, 분석 사용자는 curated 또는 serving table만 보게 한다.
- 7단계: 월말에는 S3 Storage Lens, Cost Explorer, CloudTrail, Athena usage를 같이 보고 owner 없는 테이블을 보류한다.
이 순서가 없으면 저장소는 싸게 시작해도 쿼리와 정리 비용이 뒤에서 불어난다.
Athena 비용은 파일 형식과 Workgroup 한도가 좌우한다
Athena 공식 예시는 3TB 비압축 텍스트 파일에서 한 컬럼만 조회해도 전체 3TB를 스캔해 $15가 드는 상황을 보여준다.
같은 데이터를 GZIP으로 1TB까지 줄이고 Parquet처럼 컬럼형 포맷으로 바꾸면 한 컬럼 조회 스캔량이 0.25TB까지 줄어 $1.25 예시가 된다.
이 차이는 데이터레이크 구축 비용에서 가장 빨리 체감되는 절감 포인트다.
| 결정 | 비용 영향 | 운영 기준 | 보류 기준 |
|---|---|---|---|
| CSV 원본 직접 조회 허용 | TB scanned가 커져 Athena 비용이 즉시 증가 | 개발·검증 전용 Workgroup으로 제한 | 업무 보고서가 raw CSV를 직접 스캔하면 보류 |
| Parquet 전환 | 컬럼 pruning과 압축으로 스캔량 감소 | curated zone의 기본 저장 형식으로 지정 | 변환 실패 시 원본 대체 조회가 기본값이면 보류 |
| 파티션 설계 | 날짜·tenant 조건이 쿼리 비용을 줄임 | 월, 일, 고객군처럼 실제 필터와 맞춤 | 너무 잘게 쪼개 작은 파일이 폭증하면 보류 |
| Workgroup 한도 | 실수성 대형 스캔을 차단 | 팀별 쿼리 한도와 알림 설정 | 공용 Workgroup 하나로 전사 사용하면 보류 |
| Capacity Reservation | 피크 동시성 비용을 고정 | 업무 시간 피크가 반복될 때만 검토 | 상시 저사용 환경에서 예약부터 잡으면 보류 |
이 조건이면 데이터레이크 구축 비용을 줄이는 첫 작업은 새 도구 구매가 아니라 파일 형식 전환과 쿼리 한도 설정이다.
이 경우는 BI 사용자가 raw zone을 직접 읽고 있는 조직이다.
Glue와 카탈로그는 숨은 운영비다
Glue 비용은 ETL job 한 줄로 보이지만 실제로는 개발 세션, crawler, table statistics, Iceberg compaction, materialized view refresh가 따로 움직인다.
가격표의 DPU-hour는 작업 시간이 조금만 길어져도 월 비용으로 누적된다.
Data Catalog는 1백만 metadata object까지 무료지만, 파티션과 table version이 무제한으로 쌓이면 초과 object 비용과 요청 비용이 따라온다.
- 전체 재처리는 월 1회 이하로 제한하고, 평소에는 증분 파일만 처리한다.
- crawler는 모든 prefix를 매일 돌리지 말고 신규 partition 경로만 보게 한다.
- Iceberg compaction은 쿼리 절감액과 DPU 비용을 함께 비교한 뒤 켠다.
- Data Catalog table version 보존 기간을 정하고 owner 없는 table은 삭제 후보로 둔다.
- 개발용 notebook과 interactive session에는 자동 종료 기준을 둔다.
보안과 권한을 늦게 넣으면 재구축 비용이 생긴다
데이터레이크는 많은 데이터를 한곳에 모으기 때문에 권한 설계를 뒤로 미루면 마이그레이션 비용이 다시 나온다.
Lake Formation 가격표는 database, table, column, row, cell level permission과 cross-account sharing을 no charge라고 설명한다.
그래도 권한 정책 설계, 개인정보 컬럼 분류, 승인 로그, 키 관리, 감사 대응은 내부 운영비로 잡아야 한다.
| 보안 항목 | 초기 포함 기준 | 비용 누락 지점 | 검증 방법 |
|---|---|---|---|
| 암호화 | S3 bucket 기본 암호화와 KMS key ownership 확인 | 키 요청 비용과 키 관리자 승인 시간 | bucket policy와 KMS key policy를 함께 리뷰 |
| 권한 | raw zone 직접 접근 최소화와 Lake Formation grant 기준 | 임시 권한 회수와 월별 리뷰 시간 | table·column 권한 export로 권한 변경 추적 |
| 개인정보 | PII 컬럼 태그와 masking 또는 row filter 기준 | 분류 누락 시 재처리와 재검수 비용 | 샘플링 검사와 DLP 도구 결과를 비교 |
| 감사 | CloudTrail, query history, job run log 보존 | 로그 보존 기간과 조회 비용 | 감사 요청 시 1일 안에 증적을 뽑는지 점검 |
| 공유 | cross-account share와 외부 파트너 계약 조건 | 데이터 반출 승인과 삭제 증적 관리 | 공유 table 목록과 owner를 월별 확인 |
보안팀이 나중에 붙으면 bucket 구조, table 이름, column tag, ETL job owner까지 다시 손보게 된다.
실무 시나리오 1: 로그 데이터레이크 예산
실무 시나리오 1은 서비스 로그 10TB를 raw zone에 적재하고, 월 60TB를 Athena로 스캔하는 SaaS 운영팀이다.
S3 Standard만 단순 계산하면 10TB는 10,240GB라 US East 첫 구간 기준 월 $235.52 예시가 나온다.
하지만 curated 4TB를 추가로 보관하면 저장소 예시는 월 $329.73로 올라간다.
Athena가 월 60TB를 스캔하면 쿼리 비용만 $300 예시가 된다.
여기에 Glue가 매일 8 DPU-hour를 쓰면 30일 기준 240 DPU-hour가 되고, $0.44 기준 $105.60 예시가 추가된다.
이 조건이면 첫 달 핵심은 S3 단가 협상이 아니라 Parquet 전환, partition pruning, Workgroup scan limit다.
| 항목 | 월 사용량 예시 | 단가 예시 | 월 비용 예시 |
|---|---|---|---|
| S3 raw 저장 | 10TB, 10,240GB | $0.023/GB-month | $235.52 |
| S3 curated 저장 | 4TB, 4,096GB | $0.023/GB-month | $94.21 |
| Athena SQL scan | 60TB scanned | $5.00/TB | $300.00 |
| Glue ETL | 240 DPU-hour | $0.44/DPU-hour | $105.60 |
| S3 PUT 요청 | 2,000,000 requests | $0.005/1,000 requests | $10.00 |
| S3 GET 요청 | 20,000,000 requests | $0.0004/1,000 requests | $8.00 |
실무 시나리오 2: BI 피크 쿼리와 예약 용량
실무 시나리오 2는 업무 시간마다 BI 대시보드 사용자가 몰리는 데이터팀이다.
Athena 공식 예시는 피크 15분 동안 160 DPU를 예약하면 160 DPU × $0.30 × 0.25시간으로 $12.00가 나온다고 설명한다.
나머지 45분을 16 DPU로 낮추면 16 DPU × $0.30 × 0.75시간으로 $3.60가 더해지고, 한 시간 예시는 $15.60다.
이 경우는 모든 쿼리를 예약 용량으로 묶기 전에 피크 시간, 동시성, 캐시 가능 보고서, Snowflake나 Databricks로 넘길 workload를 먼저 분리해야 한다.
반대로 비정기 탐색 분석이 대부분이면 예약보다 Workgroup 한도와 쿼리 최적화가 먼저다.
데이터웨어하우스와 lakehouse를 같이 비교한다
AWS 비교 문서는 데이터레이크가 정형, 반정형, 비정형 데이터를 모두 저장하고 schema-on-read 성격이 강하다고 설명한다.
데이터웨어하우스는 신뢰할 수 있는 정형 데이터와 빠른 보고서에 강하지만, 원본 로그와 탐색 분석을 모두 담기에는 비용과 전처리 부담이 커질 수 있다.
데이터레이크 구축 비용을 낮추려면 모든 분석을 lake로 보내는 방식도 피해야 한다.
| 선택지 | 맞는 상황 | 비용이 커지는 지점 | 연결할 내부 검토 |
|---|---|---|---|
| 데이터레이크 | 로그, 클릭스트림, 원본 보존, ML feature 탐색 | 쿼리 스캔, 작은 파일, owner 없는 table | S3·Glue·Athena 예산과 권한 구조 |
| 데이터웨어하우스 | 정형 KPI, 재무 보고, 반복 BI | compute warehouse와 storage, 동시성 | Snowflake 비용 최적화와 태그 운영 |
| Lakehouse | 원본 보존과 트랜잭션 table을 같이 원할 때 | Iceberg/Delta compaction과 catalog 운영 | Databricks·Snowflake 비교와 거버넌스 |
| CDC 미러링 | 운영 DB 변경을 분석계로 안정적으로 넘길 때 | 복제 지연, 중복 저장, 재처리 | Postgres CDC와 Snowflake 복제 비용 |
데이터레이크만으로 모든 비용을 줄이겠다는 계획은 보류하는 편이 낫다.
보고서용 curated mart, 장기 원본 보존, 탐색 분석, ML 학습 데이터를 서로 다른 비용 계정으로 보는 쪽이 안전하다.
견적서와 설계 리뷰에 넣을 스켈레톤
아래 YAML은 데이터레이크 구축 비용 견적을 받을 때 빠뜨리기 쉬운 단가와 통제 항목을 고정하는 내부 검토용 스켈레톤이다.
# data_lake_cost_model.yaml
# 목적: 데이터레이크 구축 비용을 저장, 수집, 쿼리, 카탈로그, 권한, 운영으로 분리한다.
# 단가는 2026-08-28 확인한 AWS 공식 가격표의 US East 예시이며, 실제 견적 전 리전과 환율을 다시 확인한다.
project:
primary_keyword: 데이터레이크 구축 비용
checked_date: 2026-08-28
price_region_example: us-east-1
owner:
data: data-platform-team
finance: finops
security: cloud-security
unit_prices_usd:
s3_standard_storage_first_50tb_gb_month: 0.023
s3_put_copy_post_list_per_1000: 0.005
s3_get_other_per_1000: 0.0004
athena_sql_per_tb_scanned: 5.00
athena_capacity_reservation_dpu_hour: 0.30
athena_spark_dpu_hour: 0.35
glue_etl_dpu_hour_reference: 0.44
glue_catalog_storage_per_100k_objects_month: 1.00
glue_catalog_requests_per_1m: 1.00
lake_formation_permissions: 0.00
monthly_inputs:
raw_storage_tb: 10
curated_storage_tb: 4
monthly_athena_scan_tb: 60
daily_glue_dpu_hours: 8
catalog_objects: 300000
controls:
required:
- partition_by_date_or_tenant
- convert_raw_csv_to_parquet
- set_athena_workgroup_scan_limit
- tag_s3_buckets_by_owner_and_zone
- separate_raw_curated_serving_zones
- review_lake_formation_grants_monthly
reject_if:
- no_query_scan_limit
- raw_zone_exposed_to_bi_users
- small_files_not_compacted
- pii_without_column_or_row_policy
- no_lifecycle_policy
아래 Python 예시는 실제 결제 코드를 만들기 위한 것이 아니라, 견적서의 사용량 가정을 숫자로 분해하기 위한 검토 스크립트다.
# data_lake_cost_check.py
# 목적: 견적서의 월간 데이터레이크 비용이 어떤 축에서 커지는지 빠르게 확인한다.
# 실제 결제 전에는 AWS Pricing Calculator와 각 리전 가격표로 다시 계산한다.
PRICES = {
"s3_standard_gb_month": 0.023,
"s3_put_per_1000": 0.005,
"s3_get_per_1000": 0.0004,
"athena_per_tb_scanned": 5.00,
"glue_dpu_hour": 0.44,
}
def estimate_month(raw_tb, curated_tb, athena_scan_tb, glue_dpu_hours, put_requests, get_requests):
storage_gb = (raw_tb + curated_tb) * 1024
return {
"s3_storage_usd": round(storage_gb * PRICES["s3_standard_gb_month"], 2),
"s3_put_usd": round(put_requests / 1000 * PRICES["s3_put_per_1000"], 2),
"s3_get_usd": round(get_requests / 1000 * PRICES["s3_get_per_1000"], 2),
"athena_usd": round(athena_scan_tb * PRICES["athena_per_tb_scanned"], 2),
"glue_usd": round(glue_dpu_hours * PRICES["glue_dpu_hour"], 2),
}
sample = estimate_month(
raw_tb=10,
curated_tb=4,
athena_scan_tb=60,
glue_dpu_hours=240,
put_requests=2_000_000,
get_requests=20_000_000,
)
print(sample)
스켈레톤의 숫자는 예시 리전 기준이므로 견적서에 그대로 복붙하지 말고, 조직의 리전과 약정 조건으로 바꿔야 한다.
함께 보면 좋은 글
자주 묻는 질문
데이터레이크 구축 비용은 S3 저장료만 보면 되나요?
아니다.
S3 저장료는 시작점일 뿐이고 Athena 스캔, Glue DPU, Data Catalog, 권한 운영, 로그 보존, 데이터 품질 작업을 같이 봐야 한다.
데이터레이크와 데이터웨어하우스 중 무엇이 더 싼가요?
원본 보존과 탐색 분석은 데이터레이크가 유리한 경우가 많지만, 반복 BI와 정형 보고서는 웨어하우스가 더 예측 가능한 경우가 있다.
Athena 비용을 가장 먼저 줄이는 방법은 무엇인가요?
CSV 원본 직접 조회를 줄이고 Parquet 변환, 압축, partition pruning, Workgroup scan limit를 먼저 적용하는 편이 효과적이다.
Lake Formation 권한이 무료이면 보안 비용도 없는 건가요?
아니다.
권한 기능 자체가 no charge여도 정책 설계, IAM, KMS, CloudTrail, 개인정보 분류, 월별 권한 리뷰는 운영비로 잡아야 한다.
Glue 비용은 언제 크게 늘어나나요?
전체 재처리, 긴 interactive session, crawler 반복, Iceberg compaction, 실패 재시도가 많을 때 DPU-hour가 누적된다.
데이터레이크 구축 전에 꼭 정해야 할 것은 무엇인가요?
raw, curated, serving zone의 보존 기간, owner, 접근 권한, 파일 형식, 쿼리 한도, 비용 태그를 먼저 정해야 한다.
출처와 확인일
- AWS — 데이터 웨어하우스, 데이터 레이크, 데이터 마트의 차이점 (확인일: 2026-08-28)
- Amazon S3 — Amazon S3 pricing (확인일: 2026-08-28)
- Amazon Athena — Amazon Athena pricing (확인일: 2026-08-28)
- AWS Glue — AWS Glue pricing (확인일: 2026-08-28)
- AWS Lake Formation — AWS Lake Formation pricing (확인일: 2026-08-28)
- AWS Docs — Data lakes and analytics on AWS (확인일: 2026-08-28)
- AWS Well-Architected — Data Analytics Lens (확인일: 2026-08-28)
가격, 기능, 리전별 단가는 2026-08-28 확인 기준이며 AWS 공식 가격표와 Pricing Calculator에서 달라질 수 있다.
이 글은 데이터레이크 구축 비용 검토를 돕는 일반 정보이며, 실제 계약과 보안 설계는 공식 문서, 조직 정책, 클라우드 전문가 검토를 거쳐야 한다.






댓글
댓글 쓰기