Senior Engineering Manager, Construction
Twelve Labs
- Location
- Seoul, South Korea
- Employment
- Full Time
- Work model
- Remote
- Level
- Senior
- H-1B history
- 2 approvals (FY2023)
- Posted
- 2h ago
Skills
About this role
Who we are 영상은 전 세계 데이터의 90%를 차지하지만, 그 대부분은 아직 기계가 이해할 수 없는 영역에 머물러 있습니다. 트웰브랩스(TwelveLabs)는 이 문제를 해결하기 위해 기계가 영상을 이해할 수 있도록 하는 AI 인프라를 구축합니다. 사람보다 더 정교하고 깊이 있게 영상을 이해하는 AI 모델을 통해 영상 속 시·청각 정보를 종합 분석하여 미디어·엔터테인먼트, 스포츠, 보안, 공공 분야 전반의 워크플로우에 적용하고 있습니다. NEA, Radical Ventures, Amazon, NVIDIA, Snowflake, Databricks, Index Ventures, 네이버벤처스, 한국투자파트너스, Quadrille Capital, Red Bull Ventures 등 글로벌 투자자들로부터 누적 3천억원 이상의 투자를 유치했습니다. 또한 Fei-Fei Li, Silvio Savarese, Alexandr Wang 등 세계적인 AI 리더들이 자문진으로 함께하고 있습니다. 트웰브랩스는 샌프란시스코, 서울, 뉴욕, 런던 네 개의 오피스를 거점으로 운영되는 글로벌 기업입니다. 핵심 연구개발은 서울에서 이루어지며, 전 세계 오피스의 구성원들이 이를 기반으로 다양한 산업과 시장에 영상 이해 기술을 적용해가고 있습니다. 세상의 복잡함을 이해하는 기술을 만드는 만큼, 서로 다른 배경과 관점을 가진 사람들이 모일 때 더 나은 제품을 만들 수 있다고 믿습니다. 아직 세상에 없는 답을 정의해보고 싶으신 분, 내 손으로 직접 변화를 만들어내고 싶어하시는 분을 찾고 있습니다. 트웰브랩스에서 세상을 이해하는 기술을 함께 만들어가세요. ABOUT JOCKEY Jockey는 트웰브랩스의 통합 에이전틱 시스템으로, 영상과 이미지를 넘나들며 추론합니다. Reasoning Model에 메모리 레이어를 결합해, 사용자가 보유한 영상 데이터로부터 지식 저장소를 만들어냅니다. 아무리 큰 Context Window도 영상 아카이브 전체를 한 번에 담을 수는 없습니다. 저희가 다루는 영상은 수백만 시간 규모이기 때문입니다. 모델을 한 번 실행해서 얻는 답은 '영상 한 편'에 대한 것일 뿐, 수천~수만 개 영상으로 이루어진 영상 데이터 전체를 가로지르는 추론은 아닙니다 — Context Window를 아무리 늘려도 해결되지 않는 문제입니다. 그래서 Jockey는 사용자의 질문을 여러 단계로 쪼갠 뒤, 수천 개의 영상과 이미지에서 필요한 부분을 검색하고 구간을 나누어, 그 결과를 종합해 추론합니다. 예를 들어 아카이브를 지정하고 "하이라이트 릴을 만들어줘" 또는 "가장 화제가 된 순간을 찾아줘"라고 요청하면, 바로 사용할 수 있는 타임스탬프 구간을 결과로 돌려받습니다. 영상 데이터 전체를 이해하고, 그 이해를 실제 행동으로 옮길 수 있게 만드는 것 — 이것이 Jockey라는 제품의 핵심입니다. 사람뿐 아니라 에이전트를 위해 만듭니다. AI 에이전트가 영상의 주요 소비 주체로 점점 자리잡고 있습니다. 그래서 저희는 수백만 시간 규모로 확장하면서도, 사람과 자율 에이전트 모두에게 안정적이고 높은 품질의 결과를 제공하는 Production급 인프라를 구축하고 있습니다. 우리가 직접 보유한 모델 위에서 만듭니다. 임베딩 모델인 Marengo는 "하마터면 비행기를 놓칠 뻔했던 순간" 같은 쿼리를 실제 검색 결과로 풀어냅니다. 영상-언어 모델인 Pegasus는 사용자가 정의한 스키마에 따라 구조화된 타임스탬프 정보를 반환합니다. 두 모델을 지속적으로 출시하고 개선하기 때문에 고객은 별도의 재통합 없이도 릴리스를 거듭할수록 향상되는 Jockey의 품질을 누릴 수 있습니다. 엔드투엔드로 직접 통제하는 스택 위에서 에이전트를