Why

기존 모델들의 단점

How

매번 학습하지 않아도 되는 범용 모델 : 등변성을 위해서 위치 인코딩이 없는 트랜스포머 아키텍처를 아핀 정규화 계층과 결합해서 사용한다.
밀도 출력 : Attention 공식을 KDE로 유도해서 대신 계산
기존 방법들을 합쳐서 한계였던 성능과 범용적 두 마리 토끼를 잡음

Result

평가 기준

정확도
확장성 & 일반화

활용성

Info

paper link