1. ByteDance 광고가 20K 초장기 시퀀스 랭킹을 프로덕션에 배포했다 — 레이더
자료 TM20K: Teacher Retains Full Tokens, Student Merges Efficiently — E-Commerce Sequence Modeling in Ad Recommendation — arXiv 2608.07055, 2026-08-07, 논문 (ByteDance 저자 12인)
배경
"긴 유저 시퀀스를 랭킹 모델에 그대로 넣으면 더 좋다"는 테제는 지금 tracked services 세 곳에서 서로 다른 방향으로 검증 중이다 — Meta HSTU/GEM은 파라미터·시퀀스 동시 스케일링을 주장하고 (topics/sequence-transformer-ranking.md), Meta 광고 LLaTTE는 "semantic feature가 있어야만 스케일링이 성립한다"는 반대 조건을 걸었고 (daily/2026-08-09.md), Netflix Foundation Model은 2M→1B shadow에서 "일관된 개선"을 봤다 [확인]. 세 진술이 서로 반쯤 맞물리고 반쯤 부딪히는 상태다.
여기에 오늘 ByteDance가 네 번째 진술을 추가했다 — 그런데 방향이 또 다르다. 파라미터를 늘린 게 아니라 시퀀스 길이를 20K까지 확장했고, 그걸 프로덕션 서빙 지연을 거의 안 늘리면서 해내는 방법으로 teacher/student KD를 골랐다.
새로 알게 된 것
teacher와 student 모두 full attention을 쓴다 — target-only attention(쿼리 하나에 대해서만 어텐션을 접는 흔한 최적화)이 아니라 양쪽 다 full attention
[확인]. 원문 표현:"Both teacher and student models take the full attention mechanism rather than pure target-sequence attention for effective sequence scaling." — TM20K 논문 초록, 2026-08-07
student가 가벼워지는 건 attention을 접어서가 아니라 token merge로 시퀀스 자체를 압축해서다. teacher는 무겁게 학습해 정답 신호를 만들고, KD로 student를 끌어올린다.
20K 시퀀스, ADSS +1.036%, 서빙 지연 +5.6%, 훈련·서빙 비용은 기존 SOTA와 거의 동일
[확인]— 프로덕션 배포 진술이다. ADSS는 ByteDance 광고 지표(정확한 정의는 논문 본문 확인 필요). 지연이 5.6%만 늘어난 게 사실이면 20K 확장의 서빙 임팩트가 시장 예상보다 작다."successfully deployed in ByteDance's e-commerce advertising recommender system" — 같은 초록, 2026-08-07
정본 반영 없음. tracked services는 아니라 정본 파일은 안 바꿨고, radar.md "이번 달 신규"에 새 엔트리로 추가했다.
의미 이 진술이 스케일링 법칙 스레드의 네 번째 회사 데이터 포인트다. 다만 방향이 다르다: HSTU·LLaTTE·Netflix FM은 파라미터 스케일링 이야기고, TM20K는 시퀀스 길이 스케일링을 KD로 뽑아냄. "긴 시퀀스가 좋다"는 명제 자체는 강화되지만, "그걸 어떻게 서빙 가능하게 만드는가"에 대해선 아직 회사마다 다른 답을 낸다. 세 번째 이상 회사의 초장기 시퀀스 KD 진술이 쌓이면 topic 승격을 판단.
2. Webtoon이 추천 파운데이션 모델에 RL post-training을 붙였다 — 레이더
자료 Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training — arXiv 2608.06792, 2026-08-06, 논문 (Webtoon, RecSys '26 Industry Track)
배경 추천 파운데이션 모델(recommender foundation model, RFM)은 한 번 프리트레이닝해 두고 여러 서빙 지면(홈 피드, For You, 검색 등)에 재사용하는 접근이다 — Netflix Foundation Model, Meta GEM이 이 계열의 대표 사례고 (services/netflix.md, services/facebook.md), 지면별 적응은 보통 SFT(Supervised Fine-Tuning — 감독 학습으로 세부 태스크에 미세조정)로 한다. 그런데 SFT의 목표가 click이나 like 같은 즉시 신호이면, 정말로 최적화하고 싶은 사업 지표(retention, revenue 등 sparse하고 지연이 있는 신호)와는 어긋나기 쉽다.
Webtoon이 오늘 낸 논문은 이 어긋남을 3단계 post-training으로 푸는 접근이다. LLM에서 익숙한 SFT → RLHF 시퀀스를 그대로 추천에 옮겨 놓은 형태다.
새로 알게 된 것
3단계 파이프라인: LP → FFT → RFT
[확인]- LP (Linear Probing) — 프리트레이닝된 표현을 얼려 두고 무작위 초기화된 downstream head만 먼저 안정화. head가 튀는 걸 막는 웜업 단계.
- FFT (Full Fine-Tuning) — 모델 전체를 target task로 특화.
- RFT (Reinforcement Fine-Tuning) — 학습된 reward model로 policy를 사업 지표에 정렬.
핵심 트릭: policy는 dense implicit feedback으로 학습, sparse business target은 reward model에만 쓴다
[확인]"Rather than directly optimizing the serving policy on sparse business targets, we train the policy on dense implicit feedback and use business-metric supervision only for reward modeling." — Progressive Alignment 초록, 2026-08-06
이유는 자명하다 — sparse target(예: 결제 전환)을 direct optimization에 쓰면 gradient가 거의 안 흐른다. reward model이 dense/sparse 사이의 중간 대리자 역할을 하고, policy는 dense 신호에서 학습돼 안정적이다.
온라인 A/B 결과 진술은 있지만 숫자는 없다
[확인]— abstract는 "Large-scale online A/B tests further show that the proposed framework improves production recommendation quality over a conventional non-foundation baseline" 라고만 쓴다. 구체 지표·수치는 본문에서 확인해야 한다.
정본 반영 없음. radar.md "이번 달 신규"에 새 엔트리로 추가했다.
의미 Netflix FM(services/netflix.md Foundation Model 절)이 downstream head를 어떻게 붙이는지에 대해 우리 정본이 아직 얇다 — Webtoon 논문은 그 자리에서 한 발 더 나아가 RL alignment 단계를 하나 더 얹는다. 이 접근이 두세 곳에서 더 재현되면 recsys FM 표준 파이프라인의 후반부(post-training)를 새로 그릴 필요가 생긴다. 아직은 한 회사의 첫 진술이라 관찰만.
레이더
- 오늘 arXiv cs.IR 신규 30건 triage. 3건이 수용 기준 통과했다:
- TM20K (ByteDance) — 위 1번, radar.md 이번 달 신규에 새 엔트리.
- Progressive Alignment (Webtoon) — 위 2번, 같은 자리에 새 엔트리.
- HD-Rec (arXiv 2608.06997, 2026-08-07) — Kuaishou 시니어 라인(Ruiming Tang, Guorui Zhou, Han Li) 참여. Semantic ID를 cross-domain으로 확장(계층 코드북 + domain sparse MoE). 공개 벤치마크만이라 프로덕션 진술은 아직 없다. 새 엔트리는 만들지 않고 생성형 retrieval / semantic ID 오픈 스레드에 "2026-08-11 추가 근거" 한 줄로 붙였다 — Kuaishou 라인이 SID 계열에 합류했다는 신호로만 기록.
- 나머지 27건은 순수 학술 증분(RAG 최적화, 학술 retrieval 방법론, geo/legal/edu 도메인, 음악 도메인 한정 recsys 등)이라 탈락.
- 산업 블로그 스윕은 월요일 스캔이라 오늘 안 함. 다음 스윕은 2026-08-17(월).
다음에 볼 것
- TM20K 본문 정독 — ADSS 지표 정의, teacher/student 파라미터 규모 비율, token merge의 구체 알고리즘. 초록에 없는 세부가 프로덕션 재현 가능성을 좌우한다. 심층 분석 필요 (사람이 트리거).
- Progressive Alignment 본문 정독 — 온라인 A/B 지표와 수치, reward model 학습 데이터, non-FM 베이스라인의 정체. 초록에 숫자가 아예 없어 판단이 불가능하다. 심층 분석 필요.
- Netflix FM downstream head 문서화 — 오늘 Webtoon 논문을 계기로 services/netflix.md Foundation Model 절이 얼마나 얇은지 드러났다. Netflix가 지면별로 어떻게 head를 붙이는지 공식 진술이 있는지 재확인.