데이터레이크 구축 비용 2026, S3·Glue·Athena 예산 산정 기준

데이터레이크 구축 비용 산정 회의와 클라우드 데이터 파이프라인 검토 장면
데이터레이크 구축 비용은 저장소보다 쿼리 스캔, ETL DPU, 카탈로그, 권한 운영에서 크게 흔들린다.

데이터레이크 구축 비용을 찾는 팀은 대부분 저장소 단가만 보고 첫 예산을 잡는다.

하지만 실제 월 비용 명세는 S3 용량, 요청 수, Glue 작업 시간, Athena 스캔량, Lake Formation 권한 운영, 데이터 품질 보정 시간이 함께 움직인다.

이 글은 AWS 공식 가격표와 데이터레이크 설계 문서를 기준으로, 데이터 플랫폼 담당자가 첫해 예산안을 검토할 때 바로 볼 항목만 추렸다.

핵심 요약
  • 데이터레이크는 웨어하우스보다 저렴한 저장소를 쓰지만, 쿼리 스캔과 ETL 반복이 통제되지 않으면 월 비용이 빠르게 커진다.
  • AWS S3 Standard의 US East 예시는 첫 50TB 구간 $0.023/GB-month이며, PUT/LIST와 GET 요청도 별도 과금된다.
  • Athena SQL은 TB 스캔 기준 $5.00이 핵심이므로 Parquet, 압축, 파티션, Workgroup 한도가 비용 통제의 중심이다.
  • Lake Formation 권한 자체는 no charge로 공개되어도 S3, Glue Data Catalog, Athena, CloudTrail 같은 통합 서비스 비용은 따로 계산해야 한다.

공식 가격표 핵심 숫자부터 본다

아래 표는 2026년 8월 28일 확인한 AWS 공식 가격표와 공개 가격 자료의 US East 예시를 데이터레이크 구축 비용 항목으로 다시 묶은 것이다.

서울 리전, 약정, 환율, 세금, 데이터 전송 조건은 달라질 수 있으므로 실제 계약 전에는 AWS Pricing Calculator로 다시 계산해야 한다.

비용 항목공식 공개 숫자데이터레이크에서 커지는 조건예산 검토 질문
S3 Standard 저장소$0.023/GB-month 첫 50TB, $0.022/GB-month 다음 450TB, $0.021/GB-month 500TB 초과raw와 curated zone을 모두 Standard에 오래 보관할 때원본 보존 기간과 lifecycle 전환 기준이 정해졌는가
S3 쓰기·목록 요청$0.005 per 1,000 PUT, COPY, POST, LIST requests작은 파일을 초 단위로 계속 적재하거나 파티션을 과도하게 나눌 때파일 크기 목표와 배치 주기가 정해졌는가
S3 읽기 요청$0.0004 per 1,000 GET and all other requestsBI, notebook, ETL 검증 작업이 같은 원본을 반복 조회할 때서비스 계정별 읽기 패턴을 태그로 구분하는가
Athena SQL 쿼리$5.00 per TB scanned, 10MB minimum per queryCSV 원본을 그대로 조회하거나 파티션 pruning이 실패할 때Workgroup scan limit와 쿼리 결과 저장소가 설정됐는가
Athena Capacity Reservation$0.30 per DPU-hour업무 시간 피크 동시 쿼리를 예약 용량으로 고정할 때상시 예약보다 피크 시간만 예약하는 편이 싼가
Athena Spark$0.35 per DPU-hour노트북 기반 전처리와 탐색 작업을 길게 열어둘 때개발 세션 자동 종료와 사용자별 비용 태그가 있는가
AWS Glue ETL가격표 예시는 $0.44 per DPU-hour이며 Glue 6.0+ ETL은 $0.308, Flex는 $0.203 per DPU-hour 예시가 있다매일 재처리, 대용량 join, crawler 반복, Iceberg compaction을 켤 때작업별 DPU와 재시도 횟수가 견적서에 분리됐는가
Glue Data Catalog1백만 metadata object까지 free, 초과분 $1.00 per 100,000 objects/month, 요청은 $1 per 1,000,000 requests테이블 버전, 파티션, 통계, 카탈로그가 빠르게 늘 때파티션 수와 table version 보존 정책을 제한했는가
Lake Formation 권한database, table, column, row, cell level permission과 cross-account sharing은 no charge권한은 무료라도 통합 서비스 사용량이 늘 때권한 구조 변경 로그와 월별 권한 리뷰 담당자가 있는가

S3 가격표가 싼 저장소처럼 보이는 순간부터 비용 누락이 시작된다.

데이터레이크 구축 비용은 저장 단가가 아니라 저장한 데이터를 누가, 얼마나 자주, 어떤 형식으로 스캔하는지에 따라 달라진다.

데이터레이크 구축 비용은 다섯 계정으로 쪼갠다

첫째 계정은 저장소다.

raw, curated, serving zone을 나누면 같은 원본이 여러 형식으로 남기 때문에 단순 원본 TB보다 과금 기준 TB가 커진다.

둘째 계정은 수집과 변환이다.

Glue ETL, crawler, compaction, 통계 생성 작업은 실행 시간과 DPU가 곱해져서 월 비용으로 나온다.

셋째 계정은 쿼리와 분석이다.

Athena는 인프라를 미리 띄우지 않아도 되지만, 잘못 작성된 쿼리가 수십 TB를 반복 스캔하면 저장소 절감분을 바로 지운다.

넷째 계정은 권한과 감사다.

Lake Formation 권한 자체가 무료라도 IAM, CloudTrail, KMS, 로그 보존, 승인 프로세스는 운영비로 남는다.

다섯째 계정은 품질과 소유권이다.

중복 데이터, 깨진 스키마, 소유자 없는 테이블을 정리하는 시간이 없으면 데이터레이크가 곧 데이터 늪으로 바뀐다.

계정대표 비용통제하지 않으면 생기는 문제초기 설계 기준
저장소S3 Standard, IA, Glacier, Tables, 결과 저장 버킷원본과 가공본이 동시에 늘고 lifecycle이 늦어진다zone별 보존 기간과 전환 규칙을 문서화한다
수집·변환Glue job, crawler, compaction, scheduler실패 재시도와 전체 재처리로 DPU 시간이 늘어난다증분 처리와 재처리 범위를 기본값으로 둔다
쿼리Athena TB scanned, DPU reservation, Spark sessionBI 사용자가 원본 zone을 직접 스캔한다Workgroup, quota, query result bucket을 분리한다
권한·감사Lake Formation 정책 운영, IAM, CloudTrail, KMSPII 컬럼이 과도하게 공개되고 감사 추적이 빈다column/row 권한과 승인 로그를 필수로 둔다
품질·운영데이터 계약, 테스트, 소유자 관리, lineage테이블은 늘지만 믿을 수 있는 지표가 줄어든다데이터 제품별 owner와 SLA를 만든다

이 글이 필요한 사람

  • 데이터레이크 구축 비용을 S3 월 저장료만으로 산정해도 되는지 확인하려는 데이터 플랫폼 담당자.
  • Snowflake나 Databricks 비용 최적화 전에 원천 데이터 저장과 쿼리 경로를 분리하려는 아키텍트.
  • 로그, 클릭스트림, IoT, ERP 데이터를 한곳에 모으려는데 권한과 개인정보 통제가 걱정되는 보안팀.
  • 데이터웨어하우스와 데이터레이크를 비교하면서 첫해 예산과 운영 인력을 같이 잡아야 하는 구매팀.
  • Athena, Glue, Lake Formation을 이미 쓰지만 태그와 Workgroup 한도가 없어 월 비용 분석이 어려운 FinOps 담당자.

구축 순서는 저장소보다 소비 경로부터 정한다

데이터레이크 구축 비용을 줄이려면 저장소를 먼저 만들지 말고 소비 경로를 먼저 정해야 한다.

BI 보고서, 머신러닝 피처, 감사 로그 보존, 외부 파트너 공유는 파일 형식과 권한 구조가 서로 다르다.

  1. 1단계: 월별로 들어오는 데이터 소스, 예상 TB, 파일 수, 갱신 주기, 개인정보 포함 여부를 표로 만든다.
  2. 2단계: raw, curated, serving zone을 나누고 각 zone의 보존 기간, 암호화 키, 접근 주체를 정한다.
  3. 3단계: CSV나 JSON 원본을 바로 조회하지 말고 Parquet 또는 ORC 변환 대상을 먼저 고른다.
  4. 4단계: Athena Workgroup을 팀별로 만들고 쿼리당 스캔 한도, 결과 저장 버킷, 태그를 강제한다.
  5. 5단계: Glue job은 전체 재처리와 증분 처리 경로를 분리하고 DPU, 실행 시간, 재시도 횟수를 기록한다.
  6. 6단계: Lake Formation 권한은 raw zone 직접 접근을 막고, 분석 사용자는 curated 또는 serving table만 보게 한다.
  7. 7단계: 월말에는 S3 Storage Lens, Cost Explorer, CloudTrail, Athena usage를 같이 보고 owner 없는 테이블을 보류한다.

이 순서가 없으면 저장소는 싸게 시작해도 쿼리와 정리 비용이 뒤에서 불어난다.

Athena 비용은 파일 형식과 Workgroup 한도가 좌우한다

Athena 공식 예시는 3TB 비압축 텍스트 파일에서 한 컬럼만 조회해도 전체 3TB를 스캔해 $15가 드는 상황을 보여준다.

같은 데이터를 GZIP으로 1TB까지 줄이고 Parquet처럼 컬럼형 포맷으로 바꾸면 한 컬럼 조회 스캔량이 0.25TB까지 줄어 $1.25 예시가 된다.

이 차이는 데이터레이크 구축 비용에서 가장 빨리 체감되는 절감 포인트다.

결정비용 영향운영 기준보류 기준
CSV 원본 직접 조회 허용TB scanned가 커져 Athena 비용이 즉시 증가개발·검증 전용 Workgroup으로 제한업무 보고서가 raw CSV를 직접 스캔하면 보류
Parquet 전환컬럼 pruning과 압축으로 스캔량 감소curated zone의 기본 저장 형식으로 지정변환 실패 시 원본 대체 조회가 기본값이면 보류
파티션 설계날짜·tenant 조건이 쿼리 비용을 줄임월, 일, 고객군처럼 실제 필터와 맞춤너무 잘게 쪼개 작은 파일이 폭증하면 보류
Workgroup 한도실수성 대형 스캔을 차단팀별 쿼리 한도와 알림 설정공용 Workgroup 하나로 전사 사용하면 보류
Capacity Reservation피크 동시성 비용을 고정업무 시간 피크가 반복될 때만 검토상시 저사용 환경에서 예약부터 잡으면 보류

이 조건이면 데이터레이크 구축 비용을 줄이는 첫 작업은 새 도구 구매가 아니라 파일 형식 전환과 쿼리 한도 설정이다.

이 경우는 BI 사용자가 raw zone을 직접 읽고 있는 조직이다.

Glue와 카탈로그는 숨은 운영비다

Glue 비용은 ETL job 한 줄로 보이지만 실제로는 개발 세션, crawler, table statistics, Iceberg compaction, materialized view refresh가 따로 움직인다.

가격표의 DPU-hour는 작업 시간이 조금만 길어져도 월 비용으로 누적된다.

Data Catalog는 1백만 metadata object까지 무료지만, 파티션과 table version이 무제한으로 쌓이면 초과 object 비용과 요청 비용이 따라온다.

  • 전체 재처리는 월 1회 이하로 제한하고, 평소에는 증분 파일만 처리한다.
  • crawler는 모든 prefix를 매일 돌리지 말고 신규 partition 경로만 보게 한다.
  • Iceberg compaction은 쿼리 절감액과 DPU 비용을 함께 비교한 뒤 켠다.
  • Data Catalog table version 보존 기간을 정하고 owner 없는 table은 삭제 후보로 둔다.
  • 개발용 notebook과 interactive session에는 자동 종료 기준을 둔다.

보안과 권한을 늦게 넣으면 재구축 비용이 생긴다

데이터레이크는 많은 데이터를 한곳에 모으기 때문에 권한 설계를 뒤로 미루면 마이그레이션 비용이 다시 나온다.

Lake Formation 가격표는 database, table, column, row, cell level permission과 cross-account sharing을 no charge라고 설명한다.

그래도 권한 정책 설계, 개인정보 컬럼 분류, 승인 로그, 키 관리, 감사 대응은 내부 운영비로 잡아야 한다.

보안 항목초기 포함 기준비용 누락 지점검증 방법
암호화S3 bucket 기본 암호화와 KMS key ownership 확인키 요청 비용과 키 관리자 승인 시간bucket policy와 KMS key policy를 함께 리뷰
권한raw zone 직접 접근 최소화와 Lake Formation grant 기준임시 권한 회수와 월별 리뷰 시간table·column 권한 export로 권한 변경 추적
개인정보PII 컬럼 태그와 masking 또는 row filter 기준분류 누락 시 재처리와 재검수 비용샘플링 검사와 DLP 도구 결과를 비교
감사CloudTrail, query history, job run log 보존로그 보존 기간과 조회 비용감사 요청 시 1일 안에 증적을 뽑는지 점검
공유cross-account share와 외부 파트너 계약 조건데이터 반출 승인과 삭제 증적 관리공유 table 목록과 owner를 월별 확인

보안팀이 나중에 붙으면 bucket 구조, table 이름, column tag, ETL job owner까지 다시 손보게 된다.

실무 시나리오 1: 로그 데이터레이크 예산

실무 시나리오 1은 서비스 로그 10TB를 raw zone에 적재하고, 월 60TB를 Athena로 스캔하는 SaaS 운영팀이다.

S3 Standard만 단순 계산하면 10TB는 10,240GB라 US East 첫 구간 기준 월 $235.52 예시가 나온다.

하지만 curated 4TB를 추가로 보관하면 저장소 예시는 월 $329.73로 올라간다.

Athena가 월 60TB를 스캔하면 쿼리 비용만 $300 예시가 된다.

여기에 Glue가 매일 8 DPU-hour를 쓰면 30일 기준 240 DPU-hour가 되고, $0.44 기준 $105.60 예시가 추가된다.

이 조건이면 첫 달 핵심은 S3 단가 협상이 아니라 Parquet 전환, partition pruning, Workgroup scan limit다.

항목월 사용량 예시단가 예시월 비용 예시
S3 raw 저장10TB, 10,240GB$0.023/GB-month$235.52
S3 curated 저장4TB, 4,096GB$0.023/GB-month$94.21
Athena SQL scan60TB scanned$5.00/TB$300.00
Glue ETL240 DPU-hour$0.44/DPU-hour$105.60
S3 PUT 요청2,000,000 requests$0.005/1,000 requests$10.00
S3 GET 요청20,000,000 requests$0.0004/1,000 requests$8.00

실무 시나리오 2: BI 피크 쿼리와 예약 용량

실무 시나리오 2는 업무 시간마다 BI 대시보드 사용자가 몰리는 데이터팀이다.

Athena 공식 예시는 피크 15분 동안 160 DPU를 예약하면 160 DPU × $0.30 × 0.25시간으로 $12.00가 나온다고 설명한다.

나머지 45분을 16 DPU로 낮추면 16 DPU × $0.30 × 0.75시간으로 $3.60가 더해지고, 한 시간 예시는 $15.60다.

이 경우는 모든 쿼리를 예약 용량으로 묶기 전에 피크 시간, 동시성, 캐시 가능 보고서, Snowflake나 Databricks로 넘길 workload를 먼저 분리해야 한다.

반대로 비정기 탐색 분석이 대부분이면 예약보다 Workgroup 한도와 쿼리 최적화가 먼저다.

데이터웨어하우스와 lakehouse를 같이 비교한다

AWS 비교 문서는 데이터레이크가 정형, 반정형, 비정형 데이터를 모두 저장하고 schema-on-read 성격이 강하다고 설명한다.

데이터웨어하우스는 신뢰할 수 있는 정형 데이터와 빠른 보고서에 강하지만, 원본 로그와 탐색 분석을 모두 담기에는 비용과 전처리 부담이 커질 수 있다.

데이터레이크 구축 비용을 낮추려면 모든 분석을 lake로 보내는 방식도 피해야 한다.

선택지맞는 상황비용이 커지는 지점연결할 내부 검토
데이터레이크로그, 클릭스트림, 원본 보존, ML feature 탐색쿼리 스캔, 작은 파일, owner 없는 tableS3·Glue·Athena 예산과 권한 구조
데이터웨어하우스정형 KPI, 재무 보고, 반복 BIcompute warehouse와 storage, 동시성Snowflake 비용 최적화와 태그 운영
Lakehouse원본 보존과 트랜잭션 table을 같이 원할 때Iceberg/Delta compaction과 catalog 운영Databricks·Snowflake 비교와 거버넌스
CDC 미러링운영 DB 변경을 분석계로 안정적으로 넘길 때복제 지연, 중복 저장, 재처리Postgres CDC와 Snowflake 복제 비용

데이터레이크만으로 모든 비용을 줄이겠다는 계획은 보류하는 편이 낫다.

보고서용 curated mart, 장기 원본 보존, 탐색 분석, ML 학습 데이터를 서로 다른 비용 계정으로 보는 쪽이 안전하다.

견적서와 설계 리뷰에 넣을 스켈레톤

아래 YAML은 데이터레이크 구축 비용 견적을 받을 때 빠뜨리기 쉬운 단가와 통제 항목을 고정하는 내부 검토용 스켈레톤이다.

# data_lake_cost_model.yaml
# 목적: 데이터레이크 구축 비용을 저장, 수집, 쿼리, 카탈로그, 권한, 운영으로 분리한다.
# 단가는 2026-08-28 확인한 AWS 공식 가격표의 US East 예시이며, 실제 견적 전 리전과 환율을 다시 확인한다.

project:
  primary_keyword: 데이터레이크 구축 비용
  checked_date: 2026-08-28
  price_region_example: us-east-1
  owner:
    data: data-platform-team
    finance: finops
    security: cloud-security

unit_prices_usd:
  s3_standard_storage_first_50tb_gb_month: 0.023
  s3_put_copy_post_list_per_1000: 0.005
  s3_get_other_per_1000: 0.0004
  athena_sql_per_tb_scanned: 5.00
  athena_capacity_reservation_dpu_hour: 0.30
  athena_spark_dpu_hour: 0.35
  glue_etl_dpu_hour_reference: 0.44
  glue_catalog_storage_per_100k_objects_month: 1.00
  glue_catalog_requests_per_1m: 1.00
  lake_formation_permissions: 0.00

monthly_inputs:
  raw_storage_tb: 10
  curated_storage_tb: 4
  monthly_athena_scan_tb: 60
  daily_glue_dpu_hours: 8
  catalog_objects: 300000

controls:
  required:
    - partition_by_date_or_tenant
    - convert_raw_csv_to_parquet
    - set_athena_workgroup_scan_limit
    - tag_s3_buckets_by_owner_and_zone
    - separate_raw_curated_serving_zones
    - review_lake_formation_grants_monthly
  reject_if:
    - no_query_scan_limit
    - raw_zone_exposed_to_bi_users
    - small_files_not_compacted
    - pii_without_column_or_row_policy
    - no_lifecycle_policy

아래 Python 예시는 실제 결제 코드를 만들기 위한 것이 아니라, 견적서의 사용량 가정을 숫자로 분해하기 위한 검토 스크립트다.

# data_lake_cost_check.py
# 목적: 견적서의 월간 데이터레이크 비용이 어떤 축에서 커지는지 빠르게 확인한다.
# 실제 결제 전에는 AWS Pricing Calculator와 각 리전 가격표로 다시 계산한다.

PRICES = {
    "s3_standard_gb_month": 0.023,
    "s3_put_per_1000": 0.005,
    "s3_get_per_1000": 0.0004,
    "athena_per_tb_scanned": 5.00,
    "glue_dpu_hour": 0.44,
}


def estimate_month(raw_tb, curated_tb, athena_scan_tb, glue_dpu_hours, put_requests, get_requests):
    storage_gb = (raw_tb + curated_tb) * 1024
    return {
        "s3_storage_usd": round(storage_gb * PRICES["s3_standard_gb_month"], 2),
        "s3_put_usd": round(put_requests / 1000 * PRICES["s3_put_per_1000"], 2),
        "s3_get_usd": round(get_requests / 1000 * PRICES["s3_get_per_1000"], 2),
        "athena_usd": round(athena_scan_tb * PRICES["athena_per_tb_scanned"], 2),
        "glue_usd": round(glue_dpu_hours * PRICES["glue_dpu_hour"], 2),
    }


sample = estimate_month(
    raw_tb=10,
    curated_tb=4,
    athena_scan_tb=60,
    glue_dpu_hours=240,
    put_requests=2_000_000,
    get_requests=20_000_000,
)
print(sample)

스켈레톤의 숫자는 예시 리전 기준이므로 견적서에 그대로 복붙하지 말고, 조직의 리전과 약정 조건으로 바꿔야 한다.

함께 보면 좋은 글

데이터 플랫폼 구축 2026, 도입 전 비용·성능·운영 기준 썸네일데이터 플랫폼 구축 2026, 도입 전 비용·성능·운영 기준Databricks Snowflake 비교 2026, 비용·거버넌스·운영 기준 썸네일Databricks Snowflake 비교 2026, 비용·거버넌스·운영 기준Snowflake 비용 최적화 2026, 웨어하우스·예산·태그 운영 기준 썸네일Snowflake 비용 최적화 2026, 웨어하우스·예산·태그 운영 기준Databricks 비용 최적화 2026, DBU·태그·예산 경보 운영 기준 썸네일Databricks 비용 최적화 2026, DBU·태그·예산 경보 운영 기준Postgres CDC 데이터 미러링 2026, Snowflake 복제·비용·운영 기준 썸네일Postgres CDC 데이터 미러링 2026, Snowflake 복제·비용·운영 기준데이터 품질 관리 2026, 데이터 플랫폼 도입 전 테스트·계약·모니터링 기준 썸네일데이터 품질 관리 2026, 데이터 플랫폼 도입 전 테스트·계약·모니터링 기준

자주 묻는 질문

데이터레이크 구축 비용은 S3 저장료만 보면 되나요?

아니다.

S3 저장료는 시작점일 뿐이고 Athena 스캔, Glue DPU, Data Catalog, 권한 운영, 로그 보존, 데이터 품질 작업을 같이 봐야 한다.

데이터레이크와 데이터웨어하우스 중 무엇이 더 싼가요?

원본 보존과 탐색 분석은 데이터레이크가 유리한 경우가 많지만, 반복 BI와 정형 보고서는 웨어하우스가 더 예측 가능한 경우가 있다.

Athena 비용을 가장 먼저 줄이는 방법은 무엇인가요?

CSV 원본 직접 조회를 줄이고 Parquet 변환, 압축, partition pruning, Workgroup scan limit를 먼저 적용하는 편이 효과적이다.

Lake Formation 권한이 무료이면 보안 비용도 없는 건가요?

아니다.

권한 기능 자체가 no charge여도 정책 설계, IAM, KMS, CloudTrail, 개인정보 분류, 월별 권한 리뷰는 운영비로 잡아야 한다.

Glue 비용은 언제 크게 늘어나나요?

전체 재처리, 긴 interactive session, crawler 반복, Iceberg compaction, 실패 재시도가 많을 때 DPU-hour가 누적된다.

데이터레이크 구축 전에 꼭 정해야 할 것은 무엇인가요?

raw, curated, serving zone의 보존 기간, owner, 접근 권한, 파일 형식, 쿼리 한도, 비용 태그를 먼저 정해야 한다.

출처와 확인일

가격, 기능, 리전별 단가는 2026-08-28 확인 기준이며 AWS 공식 가격표와 Pricing Calculator에서 달라질 수 있다.

이 글은 데이터레이크 구축 비용 검토를 돕는 일반 정보이며, 실제 계약과 보안 설계는 공식 문서, 조직 정책, 클라우드 전문가 검토를 거쳐야 한다.

Tech in Depth tnals1569@gmail.com

댓글

이 블로그의 인기 게시물

구글 홈 앱과 스마트싱스 연동 방법: 스마트홈 완벽 설정 가이드

Claude 주간 사용량 얼마야 | Pro / Max 플랜 주간 한도 & 효율 사용법

이글루 홈캠 vs 파인뷰 홈캠 비교: 화각, 보안, 가격까지 완벽 분석하기