transformer
nanoGPT/GPT-2식 decoder-only Transformer를 출발점으로 LLaMA의 RoPE, RMSNorm/SwiGLU, hidden dimension, seq_len, attention score, KV cache가 무엇이 다르고 어떻게 연결되는지 정리한다.
VGGT는 여러 장의 2D 이미지를 한 번의 transformer forward로 카메라 파라미터와 depth·point map으로 바꿔 전통적인 SfM/MVS 파이프라인을 크게 단순화하는 3D 재구성 모델이다.