[ Service Architecture ] Airbridge Datapipeline
Airbridge 데이터 파이프라인은 유입 이벤트를 어트리뷰션 결과, 파트너 포스트백, 리포팅 데이터, 제품 조회 상태로 바꾸는 핵심 처리 계층입니다.
Airbridge 실시간 데이터 파이프라인 아키텍처
주요 처리 경계와 데이터 이동을 압축해 표현했습니다.
이벤트 처리 흐름
수집 API는 SDK 이벤트, 서버사이드 이벤트, 리다이렉트 요청을 받아 Kafka에 원본 이벤트를 저장합니다. 이후 이벤트 검증, 이벤트 보강, 정규화, 중복 제거를 거쳐 전환 이벤트를 발생시킨 광고 이벤트를 특정하고, 각 처리 결과는 리포트, 고객사 API, 파트너 포스트백 전송 등에 사용됩니다.
저장소와 조회 경계
각 단계는 Kafka topic을 경계로 둔 domain worker로 나뉩니다. 구매 검증, 서버사이드 이벤트 보강, 전처리, 어트리뷰션/터치포인트 처리, 사용자/디바이스 매핑 갱신, 파트너 포스트백 전송, 분석 export, report materialization이 서로 다른 실패 지점과 확장 단위를 갖습니다. 운영 저장소는 설정, 체크포인트, 사용자/디바이스 매핑, 저지연 조회 상태를 담당하고, S3/Snowflake/Druid 계열 저장소는 원본 이벤트, 포맷된 이벤트, 리포트, 전송 로그를 분석과 리포팅 목적으로 보관합니다.
- 한 이벤트가 수집된 뒤 어떤 worker가 어떤 상태를 만들고 어떤 후속 결과를 남기는지 추적할 수 있도록, 수집/전처리, 어트리뷰션, 터치포인트 처리, 파트너 포스트백 전송, 분석 적재 책임을 나눠 운영합니다.
- Kafka는 원본, 전처리, 포맷, 리포트, 포스트백, 재시도 흐름 전반에서 처리 단계와 재처리 경계를 나누는 공통 스트리밍 계층입니다.
- 정규화 이후 어트리뷰션 계산과 터치포인트 처리를 별도 워커에 할당하여, 각 처리에 맞는 스택과 스케일링 정책을 이용할 수 있습니다.
- 파트너 포스트백 전송은 별도 작업 큐, 재시도, failover 경로로 처리해 외부 API 지연이나 장애가 메인 이벤트 처리와 리포트 생성 경로를 직접 막지 않습니다.