분야 레이더 — 추적 서비스 밖의 논문·트렌드
최종 갱신: 2026-08-29
추적 서비스(X·Meta·Netflix) 정본에 아직 안 들어간 것들의 워치리스트. 엔트리 규칙은 CLAUDE.md 참조 — 2~4줄 포인터, 프로덕션 관련성 기준, ~3개월 수명(승격 또는 졸업).
수집 주기: arXiv cs.IR 신규 제출 매일 triage · 산업 블로그(Google Research, Pinterest, Spotify, LinkedIn 등)·학회 accepted 목록 주 1회 스윕 — 일일 배치가 수행.
관찰 중 (오픈 스레드)
LLM-native 랭킹의 확산 — GenRec 이후 누가 따라오나
- 무엇: 서빙 경로의 채점 함수 자체를 LLM으로 바꾸는 흐름. 2026-08 현재 대규모 A/B까지 간 1차 진술은 Netflix GenRec + Meta ConnectionMind
[확인]→ llm-in-recsys.md - 왜 주목: X(주석)·Meta(피처 인코더)가 같은 길을 갈지가 향후 1년의 최대 분기였는데, Meta가 2026-08 ConnectionMind로 진입했다(⚠ 테제 절반 뒤집힘)
- 지켜볼 것: 타사(Google/YouTube, TikTok)의 서빙 경로 LLM 배포 1차 진술, GenRec 전면 롤아웃 후속, ConnectionMind의 지면 확정·서빙 코스트 후속 글
- 2026-08-12 추가 근거: Taobao MetaStrategy (arXiv 2608.09440, 2026-08-10) — LLM을 서빙 경로에 두지 않고 오프라인 정책 컴파일러로 사용하는 세 번째 각도. LLM이 typed JSON(목적 가중치, 카테고리 선호, 위치 정책, 가드레일)을 nearline 생성 → validator/compiler로 결정론적 Generator 인스턴스화 → GE 아키텍처에서 인컴번트와 원자적 경쟁. LLM inference가 sync 랭킹 밖이라 RT 영향 0, "Guess You Like" 지면 7일 A/B에서 click PV +2.11%, IPV +3.12%, GMV +2.83%
[확인]. GenRec(채점 함수)·Gryphon-v2(생성 retrieval+rank)에 이어 세 번째 프로덕션 진술이자 세 번째 서로 다른 메커니즘 - 2026-08-13 추가 근거 (레이더 아님 — 정본 반영): Meta ConnectionMind (arXiv 2608.10187, 2026-08-10) — Llama 3.1-8B가 그래프 위 경로 추론기로 헤비 유저 5–10% 온라인 hot path에 서빙, 90–95%는 그 LLM이 offline discover한 meta-path로 학습된 Student GNN. 지면 미공개("short-form video platform")이나 그래프 스키마상 Facebook 유력. watch time +0.43%. → services/facebook.md, topics/llm-in-recsys.md. Netflix GenRec의 "채점 함수" vs Meta ConnectionMind의 "그래프 경로 추론기"로 자리 3의 실체가 회사마다 다르다는 새 관전 포인트
- 2026-08-28 추가 근거: Meta AMBER (arXiv 2608.25546, 2026-08-26) — "AI at Meta" 15인 저자. Event Tokenization 각도: 각 상호작용 이벤트의 유저·아이템·컨텍스트·outcome 신호 temporal snapshot 전체를 하나의 compact Event Token으로 압축, LLM 입력의 새 토큰 유형으로 도입. Facebook surface에서 하루 수십억 이벤트 online encoding 서빙
[확인], 산업 규모 랭킹·retrieval 벤치마크에서 compute-quality Pareto 전선 개선, non-LLM 랭커에도 feature로 이식 가능(통계적 유의). Online A/B 수치 abstract 미공개. GenRec(scoring)·ConnectionMind(graph reasoning)·MetaStrategy(offline policy compiler)에 이어 네 번째 프로덕션 진술이자 네 번째 서로 다른 메커니즘(input tokenization) — Meta 안에도 LLM-based recsys 접근이 최소 두 축(그래프 추론기 + 입력 인코더)로 갈라짐
추천 모델 스케일링 법칙 — 회사별 독립 확인이 쌓이는 중
- 무엇: "데이터·파라미터를 늘리면 LLM처럼 예측 가능하게 좋아진다"는 주장의 교차 검증. Meta HSTU·Wukong
[확인], Netflix FM("일관된 개선") + 2M→1B shadow 연구[확인], Meta ads LLaTTE("semantic feature가 전제조건")[확인]→ sequence-transformer-ranking.md - 왜 주목: 스케일링이 성립하면 추천도 "더 큰 모델 + 더 긴 시퀀스" 군비 경쟁이 된다. 단 LLaTTE와 HSTU가 전제조건(semantic feature 필요 여부)에서 정반대 주장 — 미해소
- 지켜볼 것: 세 번째 회사의 독립 확인/반박, 파라미터 수 공개 사례
- 2026-08-28 추가 근거: Alibaba/Alimama TransRetrieval (arXiv 2608.25528, 2026-08-26) — Taobao & Tmall Group 6인 + RUC 4인. Field heterogeneity로 인한 token-norm divergence를 weighted average aggregation으로 억제해 Transformer가 scaling되도록 하는 광고 retrieval 프레임워크. Target token compression으로 per-candidate compute 85% 절감, position-style domain embedding으로 cross-domain 통합. Alibaba 디스플레이 광고 플랫폼 한 달 프로덕션 A/B에서 revenue +2.53% (95% CI [2.22, 2.70], p<0.0001), RPM +1.28% 동일 지연(P99 ~40ms) 유지, 4개 도메인 분산(A +1.72% / B +2.51% / C +5.39% / D +0.87%)
[확인]. Meta HSTU·Wukong·LLaTTE 이후 스케일링 법칙의 세 번째 회사 진술이자 첫 retrieval-side 진술 — LLaTTE("semantic feature 필요")·HSTU("scaling만으로")에 "field heterogeneity를 명시적으로 다루면 scaling 가능"이라는 세 번째 답
생성형 retrieval / semantic ID
- 무엇: 아이템을 ID 임베딩이 아니라 의미 토큰 열로 표현하고 autoregressive 생성으로 검색을 대체하는 계열. Spotify가 PRS 2025에서 semantic tokenization 토크를 한 것까지 확인
[확인](Netflix 것으로 흔히 오귀속 — netflix.md 열린 질문 참조) - 왜 주목: 성립하면 임베딩 스토어+ANN 스택 전체를 대체. Netflix GenPage(페이지 생성)·GenRec(언어화)이 인접 흐름
[확인] - 지켜볼 것: Google/YouTube 계열 TIGER 후속의 프로덕션 배포 진술
[추정]TIGER 원논문(RecSys 2023)은 아직 이 저장소에서 1차 확인 안 함 — 다음 스윕에서 확인 예정 - 2026-08-11 추가 근거: HD-Rec (arXiv 2608.06997, 2026-08-07) — Kuaishou 시니어 라인(Ruiming Tang, Guorui Zhou, Han Li) 참여. SID를 cross-domain으로 확장하기 위해 계층 코드북(global coarse + domain-adaptive fine) + domain sparse MoE. 공개 벤치마크만이라 프로덕션 진술은 아직 없다 — Kuaishou 라인이 SID 계열에 붙었다는 신호로만 기록
- 2026-08-12 추가 근거: Kuaishou PushDualGen (arXiv 2608.07989, 2026-08-08) — OneRec → OneRec-Thinking 다음 세대. CoT의 서빙 비용을 피하기 위해 SID를 먼저 뽑고 스킵 가능한 설명 텍스트(copy)를 붙이는 2단 생성 구조. Kuaishou 푸시 추천 프로덕션 배포, 온라인 A/B에서 effective play rate 상대 +8.50%, 불만족률 상대 −37.70%, 롱테일 노출 개선
[확인]. HD-Rec에 이어 이틀 연속 Kuaishou SID 라인 통과 — 회사 차원에서 SID 라인이 계속 진화 중이라는 신호. Netflix GenRec 외 대규모 A/B 진술이 쌓이는 두 번째 회사
학습되는 인덱스 (index-as-model) — 유기 피드로 넘어오나
- 무엇: 인덱스를 정적 자료구조가 아니라 모델 텐서/학습 대상으로 만드는 흐름. Meta SilverTorch·Andromeda/HILL 전부 광고 문헌
[확인]→ embedding-retrieval.md - 왜 주목: 광고에서 검증된 스택이 유기 피드로 넘어온 전례가 많다. 현재 유기 적용 1차 진술 없음
[추정](부재, 코퍼스는 topics 참조) - 지켜볼 것: organic feed에 same-stack 적용 진술, 타사(비 Meta)의 학습형 인덱스 채택
이번 달 신규
VK Friend Recommendation GNN — 194M 유저·28B 엣지 프로덕션 소셜 그래프에서 GNN을 messge-passing으로 스케일
- 무엇: 친구 추천은 다중 홉 소셜 컨텍스트가 유저 속성보다 결정적이라 message-passing GNN이 자연스러운데, 프로덕션 규모(수억 유저·수백억 엣지)에서 학습·서빙을 붙일 때 부딪히는 시스템·모델링 문제 두 가지를 정면으로 푼다. Multi-hash user embeddings — 각 유저 ID를 여러 해시 함수의 임베딩 lookup으로 조합해 ID 임베딩 테이블 크기를 98% 이상 축소하되 ranking quality 유지. Temporal neighbor sampling — timestamp-sorted CSR 저장 + binary search로 이웃 샘플링을
O(deg(v) + k)에서O(log(deg(v)) + k)로 단축, 슈퍼노드(팔로우가 극단적으로 많은 계정)의 이웃 순회 비용을 시간 로그로 억제[확인]arXiv 2608.27413, 2026-08-27 v1, CIKM 2026 accepted, 저자 3명(Maksim Utushkin·Andrei Ovsiannikov·Alexander D'yakonov) — 이름·본문 언급 규모로 VK로 추정[추정](HTML abstract에는 소속 표기 없음, 코드 릴리스 언급됨) - 왜 주목: 194M users · 28B edges 소셜 그래프에서 friend additions from recommendations +16%, unique friend adders +11.5% over a strong production baseline — strong prod baseline 대비 두 자릿수 uplift는 GNN 논문에서 드물다. Meta ConnectionMind가 그래프 위 LLM 경로 추론기라면 이쪽은 순수 GNN을 소셜 그래프의 스케일 한계까지 밀어붙인 케이스 — GNN이 실무에서 결국 살아남는 도메인은 완전 명시적 그래프(친구 그래프, follow 그래프)라는 관찰이 강화됨. X의 SimClusters(SVD 기반), Meta의 GNN vs LLM 이중 스택과 대조 가능한 자료. 서빙 지연 없이 얹은 것으로 abstract에 명시 없으나 두 최적화가 정확히 그 목적(테이블 축소·이웃 순회 로그화)
- 상태: 관찰 — VK가 canon의 추적 서비스가 아니라 승격은 보류. 두 번째 회사(비 Meta)의 유사 프로덕션 GNN 진술(예: LinkedIn 친구 추천, Facebook People You May Know의 GNN 갱신)이 나오면 topics/embedding-retrieval.md나 신규 social-graph-gnn topic 후보. 학회 발표 슬라이드(CIKM 2026 10월) 이후 소속·인프라 세부가 추가로 나올 가능성
SWIM (Kuaishou 메인 피드) — Generator-Evaluator 재순위의 Evaluator를 세션 서베이럴 process로 재설계
- 무엇: 산업 재순위의 G-E 아키텍처에서 Evaluator가 리스트를 채점하는데, 종전 evaluator는 단일 요청 metric(예: expected watch time)만 봐서 세션 관점을 놓친다. SWIM은 유저 행동을 finite-horizon prefix session-level survival process로 모델링, 현재 리스트가 세션 목표에 얼마나 기여하는지를 recursive survival distribution + reached-position conditional rewards로 factorize
[확인] - 왜 주목: Kuaishou short-video app(>400M DAU) 메인 피드 재순위 프로덕션 배포 — CAVE(이전 evaluator) 교체, upstream retrieval/generator는 유지. 7일 5% 트래픽 A/B에서 App stay time +0.351% (95% CI [0.27%, 0.42%]), 7-day retention +0.048% (CI [0.01%, 0.09%])
[확인]. 이번 달 DrEM·HD-Rec·PushDualGen에 이어 Kuaishou가 8월에만 네 번째 프로덕션 진술 — evaluator 자체 재설계라는 새 축(arXiv 2608.25104, 2026-08-25, 저자 Kuaishou Technology 6인 + USTC 2인 + Kun Gai 무소속) - 상태: 관찰 — evaluator 자체를 세션 survival로 재설계한 다른 회사 진술이 나오면 topics/feed-diversity.md 또는 재순위 topic 후보. 이번 달 Kuaishou가 네 편의 서로 다른 알고리즘 라인(SID cross-domain / SID+CoT 푸시 / ensemble ranking noise / G-E evaluator survival)에서 프로덕션 진술을 낸 점이 회사 차원 관전 포인트
MetaStrategy (Alibaba/Taobao) — LLM이 채점하지 않고 "실행 가능한 랭킹 전략 JSON"을 뱉는다
- 무엇: LLM 정책이 요청 컨텍스트를 받아 typed JSON 번들(objective weights, content/category preferences, experience constraints, position policies)을 생성 → 결정론적 validator/compiler가 격리된 Generator로 인스턴스화 → GE(Generator-Evaluator) 아키텍처에서 list-level Evaluator 하에 인컴번트와 원자적으로 경쟁
[확인]. 훈련: production-path replay(로그된 요청을 사용자 노출 없이 재실행) + 3종 reward(selection·relative-rank·baseline-lift) + self-competitive curriculum + Evaluator-routed on-policy distillation으로 4B×2 teacher → 0.8B student. - 왜 주목: Taobao Homepage Guess You Like에 diff-triggered nearline 배포 — LLM inference가 동기 랭킹 밖이라 RT 영향 관측 없음. 7일 유저 랜덤화 A/B에서 처리군 GE call의 27.93% 승리, click PV +2.11%, IPV +3.12%, 거래액 +2.83%
[확인]. Netflix GenRec(온라인 채점 LLM)·Yandex Gryphon-v2(온라인 생성 LLM)와 대비되는 오프라인 정책 컴파일러 각도로 LLM-native 스레드의 세 번째 메커니즘 arXiv 2608.09440, 2026-08-10 - 상태: 관찰 — 같은 지면(Taobao 홈피드)의 DREAM과 대칭 관계(정책 컴파일러 vs 실시간 튜너). 세 번째 회사의 유사 nearline LLM 정책 컴파일러 진술이 나오면 topics/llm-in-recsys.md에 절 후보
DREAM (Alibaba/Taobao) — 기존 파이프라인 위에 agentic 메타 제어 레이어를 얹는다
- 무엇: retrieval/rank/re-rank 파이프라인을 그대로 두고 위에 policy layer를 얹는 아키텍처. 3층 Intent Engine(L0/L1/L2)이 온디바이스 신호를 구조화된 인텐트로 융합하고 엣지-클라우드 트리거 체인으로 리포팅 볼륨을 ~8.7%로 압축 → MetaModel이 M1(인텐트 요약)-M2(Strategy Memory 참조 전략 계획)-M3(파라미터 번역) 순 추론해 파이프라인 파라미터를 조정 → 안전 가드레일 통과 후 배포. Reward Dual Loop(오프라인 시뮬 + 온라인 피드백)로 이중 최적화
[확인] - 왜 주목: Taobao 홈피드 A/B에서 re-ranking 제어만 적용 시 IPV +2.06%·Core IPV +2.39%·GMV +0.88%, fine ranking까지 확장 시 각각 +2.71%·+3.06%·+1.31%, PV 일관 +1% 이상
[확인]. "neither replacement of pipeline models nor compromise of serving stability" — 모델 교체 없이 파라미터 튜닝만으로 얻은 이득이라는 점이 특이. MetaStrategy와 저자 상당수 겹침(Chengyu Lai, Jiuning Lin, Bin Zhang, Han Zhu 등) — 같은 조직의 두 실험선일 가능성 arXiv 2608.09408, 2026-08-10 - 상태: 관찰 — MetaStrategy와 함께 "산업 추천 파이프라인 위 LLM/agentic 제어 레이어" 흐름. 두 접근이 하나로 수렴하는지, 별도 병렬 배포되는지가 다음 관전 포인트
TM20K (ByteDance 광고) — 20K 시퀀스 랭킹을 teacher/student KD로 프로덕션 배포
- 무엇: teacher와 student 모두 full attention(target-only가 아님)을 유지하되 student는 token merge로 시퀀스 압축. teacher가 무거운 훈련으로 정답을 만들어 KD로 student를 끌어올린다
[확인]. 배포 결과: 시퀀스 길이 20K, ADSS +1.036%, 서빙 지연 +5.6%, 훈련·서빙 비용은 기존 SOTA와 "nearly the same". - 왜 주목: Meta HSTU/GEM(광고)·LLaTTE 계열이 주장한 "긴 시퀀스 = 더 좋은 랭킹" 테제의 세 번째 회사 프로덕션 진술 — ByteDance 광고에서 20K까지 실제로 돌렸다. 스케일링 법칙 스레드의 새 데이터 포인트. 다만 순수 파라미터 스케일이 아니라 시퀀스 스케일을 KD로 뽑아낸 접근이라 방향은 다르다 arXiv 2608.07055, 2026-08-07
- 상태: 관찰 — Meta LLaTTE("semantic feature 없으면 스케일링 안 됨") vs HSTU("scaling만으로 됨") 미해소 논쟁에 20K 시퀀스 KD 라인이 제3의 접근으로 붙는다. 세 번째 회사 이상의 초장기 시퀀스 진술이 쌓이면 topics/sequence-transformer-ranking.md에 절 추가
Progressive Alignment (Webtoon) — recsys foundation model에 RL post-training 도입
- 무엇: 추천 파운데이션 모델을 서빙 지면별로 SFT할 때 click/like 목표가 사업 지표와 어긋나는 문제를 3단계로 푼다. LP(Linear Probing — 프리트레이닝된 표현을 얼려 두고 무작위 초기화된 downstream head만 안정화) → FFT(Full Fine-Tuning — 전 모델을 target task로 특화) → RFT(Reinforcement Fine-Tuning — 학습된 reward model로 사업 지표에 정렬). 핵심 트릭: policy는 dense implicit feedback로 학습하고 sparse business target은 reward model에만 쓴다
[확인]. 대규모 online A/B에서 non-FM 베이스라인 대비 개선 주장(구체 숫자는 abstract에 없음). - 왜 주목: 추천 파운데이션 모델의 downstream 정렬에 LLM식 RLHF 파이프라인을 그대로 옮긴 프로덕션 진술. Netflix Foundation Model이 downstream head를 붙이는 방식과 대비 가능 — Netflix는 서빙 서피스별 head를 학습으로 붙이고, Webtoon은 그 위에 RL 정렬 단계를 하나 더 얹는다 arXiv 2608.06792, 2026-08-06 (RecSys '26 Industry Track)
- 상태: 관찰 — Netflix FM / Meta GEM의 downstream 적응 절과 크로스체크 자료. 추가 프로덕션 사례가 나오면 topics/multi-task-ranking.md 또는 신규 topic(recsys post-training) 후보
Gryphon-v2 (Yandex Music) — generate-and-rank 단일 모델이 캐스케이드를 대체
- 무엇: 유저 이력을 한 번 인코딩 → autoregressive 디코더로 Semantic-ID 후보 생성 → 카탈로그 아이템 해결 → 공유 인코더 상태를 재사용하는 item-level 랭커. retrieval + rerank + rank를 단일 모델로
[확인] - 왜 주목: 프로덕션 A/B에서 "replaces the production cascade of 15+ candidate generators, pre-ranking and final ranking", active users +1.41%, 서빙 지연 캐스케이드와 비교 가능. Netflix GenRec 계보와 정면으로 대응하는 두 번째 프로덕션 진술 — GenRec은 랭킹 경로 LLM인 반면 Gryphon-v2는 retrieval+ranking 통합 arXiv 2608.06213, 2026-08-06
- 상태: 관찰 — 음악 도메인이지만 메커니즘이 도메인 무관이라 정본 topic (llm-in-recsys, embedding-retrieval)에 승격 후보. 세 번째 회사(플랫폼)의 유사 진술이 나오면 topic 승격 판단
- 2026-08-13 추가 근거: Yandex Music Sona (arXiv 2608.11015, 2026-08-11) — 같은 회사의 후속. "My Vibe on smart speakers" 지면에서 candidate generation + ranking을 단일 아키텍처로 통합, 프로덕션 A/B에서 "replaced the entire production cascade", active users +4.53%, total listening time +6.30%
[확인]abstract. Gryphon-v2(전체 캐스케이드, +1.41% AU)와 별개 지면(스마트 스피커)에 별개 모델을 배포한 것으로 보이나 관계 미확인. Yandex Music이 짧은 기간에 두 편의 프로덕션 논문을 냈다는 것 자체가 SID+LLM 통합 랭커 계열에 회사 차원 리소스가 붙어있다는 신호
DrEM (Kuaishou 단편 비디오) — pxtr 노이즈 이중 보정 ensemble ranking
- 무엇: 앙상블 랭킹 단계에서 상위 멀티태스크 모델의 pxtr(예: pctr/pvtr/pcmtr/pftr) 예측 노이즈가 (a) proxy preference 라벨을 뒤집고 (b) feature-side 입력으로 유입돼 순위 스코어를 흔드는 문제. supervision side는 pairwise flip probability로 empirical risk를 정정하는 robust loss, feature side는 예측 노이즈 분포에서 샘플링한 perturbation에 대해 preference-preserving ranking consistency regularizer. 이론적으로 flip probability 추정 오차 아래서도 robust loss가 basic pairwise loss보다 우월함을 증명
[확인]— arXiv 2608.12778, 2026-08-13, 저자 8명(Kuaishou Technology Beijing + Shenzhen University 협업, HTML 소속 표기 확인, Kaiqiao Zhan / Xiaoxiao Xu / Tiantian He 등이 Kuaishou 라인) - 왜 주목: Kuaishou 산업 단편 비디오 플랫폼의 EMER·EASQ production 백본 위에 얹어 7일 유저 랜덤화 A/B, 메인 트래픽 5.1% 배정, 모든 지표 p<0.005. 처리군 지표: Follow +1.197% / Comment +1.388% / Video View +0.691% / Long View +0.401% / Like +0.625% / Forward +0.683% / App Stay Time +0.116% / LT7 +0.017% (EMER 백본 기준). 저자들 자체 관찰: sparse behavior(팔로우·댓글)가 dense behavior(뷰·롱뷰)보다 gain이 크다 — 스파스 태스크가 예측 분산이 커서 flip probability가 높고, 그만큼 robust correction의 여지도 크다는 이론 예측과 일치
- 상태: 관찰 — Kuaishou가 HD-Rec/PushDualGen SID 라인에 이어 pxtr ensemble 라인에서도 프로덕션 진술을 8월에 3편째 냈다. 세 프로덕션 진술이 모두 다른 알고리즘 계열(SID cross-domain / SID+CoT 푸시 / ensemble ranking noise robustness)이라는 점이 특징 — Kuaishou가 대규모로 앙상블 랭킹의 label noise·feature noise 이론화를 프로덕션에서 확인한 첫 사례로, 유사 문제(다목적 랭킹 조합에서 pxtr 노이즈)를 겪는 회사(X·Meta·Netflix 다 해당)의 참조 자료로 유효. topic 승격은 두 번째 회사의 유사 진술이 나오면
SDF (Google Discover) — 2년 프로덕션 staleness 필터, supersession + decay 이중 학습 모델
- 무엇: 콘텐츠 피드의 "낡음"을 두 다른 메커니즘으로 분해. Supersession(새 아이템이 이전 아이템을 무효화 — 예: 이적 확정 소식 이후 이전 협상 기사) — pairwise classification framework, LLM 파이프라인으로 합성 학습 데이터 생성 + 지식 증류로 학생 모델 서빙. Relevance Decay(후속 아이템 없어도 시간에 따라 자연 감쇠 — 예: "오늘 밤 유성우" 안내) — 아이템의 멀티모달 콘텐츠(텍스트·이미지·비디오)를 입력으로 lifetime visit traffic으로 학습된 multi-horizon PTR (Predicted Traffic Ratio) 회귀 모델. 두 필터를 disjunction(OR)으로 결합해 ranking 이전 upstream candidate pruning 단계에 배치
[확인]— arXiv 2608.15780, 2026-08-16 제출, CIKM Applied Research Track 2026 accepted (DOI 10.1145/3799682.3840082), 저자 6명 전원 Google LLC (HTML 판 affiliation 표기 확인, @google.com 도메인) - 왜 주목: Google Discover 프로덕션 2년 배포, DAU 수억 명·MAU 수십억 명. user-filed staleness reports 54.9% 감소 (pre-deployment baseline 대비 — supersession filter 단독 64.0%, decay filter 단독 34.4%). Engagement-neutral 제약 하 튜닝(인위적으로 aggressive하게 자르면 지표가 더 좋아지지만 engagement 하락 때문에 배제)
[확인]4.2절. X의IS_STALE_POST14Dbool feature(14일 시간 규칙 기반 + count zero stamp)와 대조되는 완전 학습 기반 접근이며, staleness를 randor 이전에 아예 제거하는 위치가 X의 "랭커에게 명시 라벨" 위치와 근본적으로 다르다 - 상태: 관찰 — Google Discover가 아직 canon의 추적 서비스가 아닌 이유는 retrieval·ranking·다양성 등 나머지 스택이 미공개이기 때문. 두 번째 컴포넌트 공개가 나오면 정본 등록 재검토. Netflix Foundation Model / Meta ConnectionMind가 stale item 처리를 어떻게 다루는지 미확인 — 두 번째 회사의 유사 진술이 나오면
topics/에 staleness 절 신설 후보
Tlow (WeChat/Tencent) — flow-based item tokenizer가 RQ-VAE 대안으로 프로덕션 CTR +10.32%
- 무엇: Semantic ID(SID) 라인의 핵심 컴포넌트인 item tokenizer(각 아이템의 의미 임베딩을 discrete token ID 시퀀스로 변환)에서 표준 방법인 RQ-VAE(Residual-Quantized VAE)의 알려진 세 문제 — codebook collapse(대부분 code slot이 죽고 소수만 활용됨), quantization 오류의 residual 축적, 유사한 아이템이 완전히 다른 token 시퀀스로 매핑되는 불연속성 — 를 normalizing flow로 접근. Flow는 invertible neural network로 임베딩 공간을 학습 가능한 분포로 변환·역변환, tokenization의 codebook 활용률과 semantic locality 두 축에서 RQ-VAE보다 낫다는 주장
[확인]arXiv 2608.24176, 2026-08-25 v1 - 왜 주목: China's largest social media platform WeChat(Tencent) 프로덕션 A/B로 abstract에 명시 — retrieval model based on token IDs가 user CTR +10.32% globally, +11.64% for new items. 신규 아이템에서 더 큰 개선폭은 콜드스타트에 특히 강하다는 시사(semantic tokenization 라인의 핵심 이점이 프로덕션 지표로 확인). 지금까지 SID 라인은 대체로 "RQ-VAE + downstream 모델" 조합이었는데, tokenizer 층을 flow 기반으로 대체해도 프로덕션 유효 지표 개선이 나오는 첫 진술. RQ-VAE의 codebook collapse가 실제 서빙에서 문제였다는 방증
[추정]— Tencent가 이 문제를 겪고 대안을 내놓은 것으로 해석. 저자 소속은 Tencent WeChat rec 그룹 (Chonggang Song·Nian Li등 저자 명단 + WeChat 프로덕션 진술로 확정) - 상태: 관찰 — SID/generative retrieval 스레드에 새 축(tokenizer 아키텍처 자체가 프로덕션에서 갈리기 시작). (a) code + 상세 flow structure 후속 공개, (b) 두 번째 회사(Kuaishou/ByteDance/Xiaohongshu)의 유사 tokenizer 대안 진술 여부가 관전 포인트. Tencent WeChat rec은 최근 조용한 편이었는데 이 논문 이후 Weixin Video Channels 등 다른 지면의 진술이 이어질지 관찰 가치
TAGR — 익명 대형 e-commerce live-stream 광고 플랫폼, revenue +16.1%
- 무엇: 라이브 스트리밍 광고는 컨텐츠·상품·유저 피드백이 분 단위로 바뀌는 특성상 recommender에 강한 freshness 요구를 걸어놓는데, 지금까지 generative recommender(SID 기반) 라인은 대부분 static 카탈로그를 가정. Temporally Adaptive Generative Recommendation — abstract에서 "designed for rapidly changing live content, promoted products, and user feedback"으로 표현. 구체적 시간축 adaptation 메커니즘(tokenizer 재학습 주기? online update?)은 abstract에 미공개
[확인]arXiv 2608.24034, 2026-08-25 v1 - 왜 주목: "a large-scale e-commerce live-stream advertising platform" 프로덕션 배포로 abstract 진술 — live-room entry rate +8.5%, shopping-cart click rate +7.4%, revenue +16.1% over production baseline. Twitch(Amazon) Multi-Objective 라이브와 Netflix의 라이브 콜드스타트 이후 라이브 스트리밍 랭킹 스레드에 세 번째 회사. 광고 지면·중국 e-commerce 라이브라는 다른 각도 — generative recommender가 광고·라이브·rapid change 도메인에도 프로덕션 진술 축적. 다만 저자 소속·플랫폼 이름 abstract 미공개(중국 e-commerce live-stream 대표 후보는 Kuaishou·Alibaba Taobao Live·Douyin·Xiaohongshu, 저자 이름으로는 어느 회사와도 직접 매칭 안 됨
[추정]) - 상태: 관찰 — v2 이후 저자 소속 공개 시 정본 승격 재검토. 두 번째 회사의 유사 라이브+generative 진술 나오면 topics/multi-task-ranking.md나 신규 live-streaming topic 승격 후보. 플랫폼 미확인이 가장 큰 약점 — 저자 이메일 도메인 확인이 다음 단계
HEGM (VK 러시아) — 짧은 비디오 watch-time 분포 예측, 프로덕션 A/B 상세 수치 공개
- 무엇: 짧은 비디오 랭킹의 핵심 회귀 타깃인 watch time 조건부 분포(near-zero-inflated·long-tailed·multimodal) 예측. 기존 SOTA인 EGMN(Exponential-Gaussian Mixture Network — Gaussian mixture로 밀도 전체를 모델링해 단일 point estimate가 아니라 CDF 임계 이벤트 예측을 지원)의 세 가지 실패 모드 — variance collapse(σ_k(x)→0이 되어 특정 샘플에 likelihood spike), component redundancy(여러 Gaussian이 μ_i≈μ_j·σ_i≈σ_j로 수렴), inactive components(대부분 mixture weight가 0으로 붕괴) — 를 반복 재현하면서 대응책을 얹었다. HEGM(Hierarchical Exponential-Gaussian Mixture): (a) sigmoid gate가 skip 확률
p_skip(x) = σ(W_skip h + b_skip)예측 → skip일 땐 exponential 컴포넌트, 아닐 땐 Gaussian mixture로 밀도 결합(계층적 skip-watch decomposition으로 "quick skip = 무관심"과 "engaged viewing = 실제 시청"을 판정 층에서 분리), (b) KL 기반 variance regularization, (c) structured initialization, (d) forced Gaussian shift 제거, (e) entropy regularizer 제거[확인]arXiv 2608.23356, 2026-08-24 제출, github.com/rw404/HEGM 코드·모델 공개 - 왜 주목: VK(러시아 대형 소셜 플랫폼) 대규모 short-video 지면 프로덕션 A/B, 1.5개월(1개월 forward + 2주 reverse swap) 테스트에서 처리·대조군 각 5% 트래픽, 일당 각 그룹 ~11M 요청 처리
[확인]HTML 판. 결과: session depth +9.26%, deep watch(≥10s) +5.75%, non-short watch(≥3s) +4.59%, skips(<3s) −6.23%, shares +14.59%, dislikes −8.34%. Kuaishou DrEM에 이어 짧은 비디오 프로덕션 랭킹 논문의 또 다른 회사(VK) 진술로, 특히 watch-time 조건부 분포 예측(EGMN 라인)이 별도의 계보로 진화 중임을 확인. 저자 전원 AI VK + Lomonosov Moscow State University 겸직 — Yandex Music Gryphon-v2/Sona 라인과 별개 회사의 러시아 리서치 소스가 프로덕션 진술을 잇달아 쌓고 있음 - 상태: 관찰 — Netflix Foundation Model의 watch-time head·X Phoenix의 quantile head 5분위(4세대+4)와 대비 가능한 자료. HEGM은 회귀 자체를 분포 예측으로 처리(Netflix·X의 point estimate + quantile 조합과 다른 각도). 두 번째 회사(VK 외)의 EGMN 계열 프로덕션 논문이 나오면 topics/multi-task-ranking.md에 절 후보
User Behavioral Densing Law (Ant/Alipay) — 3번째 회사의 스케일링 법칙 확인
- 무엇: 유저 행동 시퀀스 데이터가 billion-scale로 커지면 raw 텍스트 스케일링만으론 성능이 diminishing return에 걸리고 tokenization 이 필요하다는 문제. 이 논문은 tokenization 최소 충분 용량 C*와 데이터 스케일 s 사이 densing law
ln C*(s) = β + α ln(s/s_0)(단일 차원) 또는ln C*(s) = β + Σ_i α_i ln(s_i / s_{i,0})(다차원)을 이론·실험으로 도출. 이를 근거로 ALGN — 데이터 스케일에 따라 tokenization capacity를 적응적으로 조절하는 variable-length 방식을 제안[확인]arXiv 2608.23392, 2026-08-24 제출, DeepFind Team @ Ant Group + Zhejiang University 협업 - 왜 주목: Meta HSTU·Wukong·GEM 계열과 Netflix Foundation Model의 스케일링 확인에 이어 Ant Group(Alipay) 데이터의 스케일링 법칙 형식화 — 다만 이번은 파라미터 스케일이 아니라 tokenization capacity 스케일의 법칙이라는 새 각도. LLM 도메인의 Densing Law(arXiv 2412.04315)의 명명·수식 구조를 그대로 추천 도메인의 tokenization으로 옮긴 접근. 다만 offline 벤치마크만(0.5M user held-out set × 3 downstream task: classification, text retrieval, user-to-user retrieval) — 프로덕션 A/B 진술은 없음, 배포 상태 미공개
- 상태: 관찰 — 스케일링 법칙 스레드에 세 번째 각도(tokenization capacity 스케일링). Ant Group의 다른 프로덕션 진술(예: 이 densing law가 Alipay 서빙 스택에 반영됐다는 후속)이 나오면 topics/sequence-transformer-ranking.md 승격 후보
Descriptive Reasoning Trace가 Recommendation Effectiveness를 떨어뜨린다 (Spotify Research) — SID+CoT 라인의 첫 반박 진술
- 무엇: Semantic ID(SID) 기반 generative recommender에 chain-of-thought 재추론 트레이스를 붙이는 최근 흐름(SIDReasoner 등)이 실제로 traditional offline 지표를 개선하는지 통제 실험. 2×2 factorial: {SID vs Title 아이템 표현} × {No Reasoning vs Reasoning} × 3개 Amazon 도메인, 공통 Qwen3-1.7B 백본. 결과: explicit reasoning trace를 도입하면 SFT·RL 모두에서 traditional offline effectiveness가 감소 — 예를 들어 Office Products + Titles에서 R@10이 .1587 → .1416 (−11%), 전체 domain 범위로 Titles는 −19% ~ 0%, SIDs는 −9% ~ 0% 저하. Title이 SID보다 더 grounded하고 interpretable한 trace를 생성함에도, extensive SID alignment는 trace quality는 올리지만 recommendation effectiveness를 못 살림. Richer reward signal이 부분적으로 gap을 좁힘
[확인]arXiv 2608.23154, 2026-08-24 제출, 저자 6명 전원 Spotify Research(이메일 domain@spotify.com으로 HTML 판 affiliation 확인) - 왜 주목: Kuaishou PushDualGen이 SID + skippable copy(CoT-lite) 조합으로 프로덕션 지표 개선(effective play rate +8.50%, 불만족률 −37.70%)을 진술했는데, Spotify Research의 통제 실험은 CoT가 recommendation effectiveness를 오히려 낮춘다는 반대 방향의 관찰. 다만 두 자료는 조건이 다름: Kuaishou는 push 지면·프로덕션 A/B·실 카탈로그, Spotify는 offline·Amazon reviews·small(1.7B) 백본. negative result의 조건부 유효성을 캐치하는 게 목적 — Spotify가 "trace를 붙이면 지표 하락, alignment를 늘려도 안 됨"이라는 재현 가능한 반박점을 만들었기 때문에 SID+CoT 라인의 다음 프로덕션 진술을 볼 때 이 조건들(백본 크기·offline vs online·reward 설계)이 관건이 됨
- 상태: 관찰 — llm-in-recsys.md의 SID + reasoning 브랜치에 반증점으로 링크. 두 번째 회사의 유사 반박·조건부 확인 진술이 나오면 topic에 별도 절(SID + reasoning trace: production vs benchmark 논쟁) 후보
GateDiffInt (Xiaohongshu) — 유저 행동 시퀀스에 diffusion 노이즈 제거 + LLM 다중 인텐트 증류를 얹은 CVR 랭커
- 무엇: 유저 행동 시퀀스의 noise-intent coupling(노이즈가 참 인텐트를 희석하고, 구조화된 인텐트 prior 없이는 denoising 타겟이 없다는 문제)을 두 축으로 푼다. Gate-Mediated Controllable Diffusion — dual gating이 붙은 controllable forward diffusion 과정으로 행동 시퀀스를 enhance·denoise. Multi-Intent LLM Distillation — LLM teacher가 long-term / short-term / latent / conversion 네 종류의 구조화된 인텐트를 lightweight student로 증류, attention으로 융합해 CVR 예측
[확인] - 왜 주목: Xiaohongshu 프로덕션 primary traffic 배포, hundreds of millions DAU 서빙, "substantial GMV improvements" 진술(구체 uplift 숫자는 abstract 미공개). OneModel이 유기·광고·상점의 랭커 통합 각도라면 이쪽은 같은 회사의 행동 시퀀스 인코더 + CVR 헤드 각도로 독립. LLM을 서빙에 두지 않고 teacher로만 쓰는 접근이라 MetaStrategy(offline policy compiler)의 사촌 arXiv 2608.18764, 2026-08-19 v1 / 2026-08-20 v2, 저자 이메일 도메인
xiaohongshu.com(PDF 메타에서 확인) - 상태: 관찰 — Xiaohongshu가 짧은 기간에 두 편 프로덕션 진술(OneModel + GateDiffInt), 각기 다른 계층(랭커 통합 / 시퀀스 인코더). 두 번째 회사의 유사 진술(diffusion을 시퀀스 denoising에 쓰는 프로덕션 랭커) 나오면 topics/sequence-transformer-ranking.md에 절 후보. v3 이후 구체 uplift 숫자 공개 여부 확인 예정
OneModel (Xiaohongshu) — 유기·광고·상점 3개 지면을 하나의 랭커로 통합
- 무엇: 유기 추천(Explore Feed) + 광고(Feed Advertising) + 상점(Merchant Recommendation)을 하나의 랭커로 서빙. 이종 행동을 공유 이벤트 시퀀스로 매핑, action-oriented backbone으로 long-context user representation, Scenario-aware Information Modulation으로 cross-stream transfer와 stream-specific specialization 밸런싱. 프로덕션 최적화: stratified user representation, multi-objective training, feature decomposition, user feature prefetching, shared user-tower computation, graph-level inference optimization
[확인] - 왜 주목: Xiaohongshu 프로덕션 A/B로 Explore Feed Time Spent +0.33%·Engagement +1.25%, Feed Advertising value +3.43%·CTR +8.18%, Merchant Recommendation DGMV +1.1867%·GPM +2.1585% — 하나의 랭커가 여러 비즈니스 스트림을 통합 서빙의 세 번째 프로덕션 진술(Netflix FM = 서비스 다양성 foundation→head, Meta GEM = 광고 domain 안 지면 다양성, Xiaohongshu OneModel = 광고·유기·상점 대등 통합). Meta GEM은 광고 domain 중심이지만 OneModel은 유기·광고·상점을 대등하게 통합한다는 새 각도 arXiv 2608.18606, 2026-08-19 v2
- 상태: 관찰 — 아직 canon의 추적 서비스가 아니고 서비스 정본(services/xiaohongshu.md) 신설도 하지 않음. 두 번째 회사(중국 밖 플랫폼)의 유사 진술이 나오면
topics/multi-task-ranking.md또는 신규 unified-multi-scenario topic 승격 후보. "action-oriented backbone" 아키텍처 세부와 cross-stream transfer 게이팅 메커니즘이 후속 논문·발표에서 나오는지가 지켜볼 포인트
Multi-Objective Ranking for Live-Streaming (Twitch) — delayed feedback window
- 무엇: 라이브 스트리밍 특성상 즉시 신호(click, initial watch)와 지연 신호(session length, retention)의 시간 스케일이 다른 문제. delayed window collection + multi-model architecture로 fresh vs delayed 신호를 각기 학습해 결합
[확인] - 왜 주목: Twitch(Amazon) mobile live feed에서 online A/B, DAV·ARPU 유의미 개선 진술. Netflix의 라이브 콜드스타트(RecSys 2025)와 인접하지만 이쪽은 일반 라이브 피드 다목적 랭킹 — segment-aware targeting까지 붙는다 arXiv 2608.04455, 2026-08-05
- 상태: 관찰 — Netflix 라이브 콜드스타트와의 크로스체크 자료로 유용. 정본 반영은 라이브 지면을 추적하는 서비스가 늘 때까지 보류
졸업 / 종료
(아직 없음)