Gurae Tech News

Tech Moves. We Track.

Advertisement

AWS EC2 메탈에서 Firecracker로 강화학습 롤아웃 고밀도 실행 최적화

기사 주제 관련 자료 이미지. 실제 사건 현장 사진이 아닙니다.
사진: İsmail Enes Ayhan / Unsplash. 기사 주제 관련 자료 이미지. 실제 사건 현장 사진이 아닙니다.

현대 강화학습 시스템은 수천 개의 롤아웃 환경을 병렬로 실행하며, 각 환경은 Firecracker 기반의 격리된 마이크로VM에서 동작한다. 이때 샌드박스 재활용 속도가 빠를수록 시간당 학습 스텝 수가 증가해 비용 효율성이 높아진다.

기사 주제 관련 자료 이미지. 실제 사건 현장 사진이 아닙니다.
사진: BoliviaInteligente / Unsplash. 기사 주제 관련 자료 이미지. 실제 사건 현장 사진이 아닙니다.

Amazon EC2 메탈 인스턴스는 Nitro 하드웨어를 통해 네트워크, 스토리지, 보안을 전담하며, Firecracker는 빠른 부팅과 작은 메모리 풋프린트를 가진 경량 가상화 기술이다. 두 기술의 결합으로 하드웨어 직접 접근과 고밀도 가상화가 가능해졌다.

롤아웃 밀도는 CPU 코어 고정, NUMA 메모리 배치, SMT 활성화 여부 등 다양한 튜닝 변수에 따라 달라진다. AWS는 labsweep이라는 측정 도구를 제공해 다양한 설정에서 지연 시간과 밀도를 체계적으로 평가할 수 있도록 지원한다.

실제 실험 결과, 마이크로VM 밀도가 vCPU 수와 1:1 비율에 도달할 때까지 꼬리 지연 시간이 안정적이며, 이를 넘으면 급격히 증가한다. SMT 설정은 I/O 바운드 작업에 유리하며, 코어 고정은 꼬리 지연 시간을 줄여 RL 학습의 전체 성능에 긍정적 영향을 준다.

AWS는 사용자가 자신의 워크로드에 맞게 labsweep을 활용해 최적의 밀도와 설정을 찾아 비용과 성능을 균형 있게 조절할 것을 권장한다. 또한 메모리 요구량이 높은 경우 메모리 최적화 인스턴스 선택도 고려해야 한다.

출처: AWS Compute