Transformer Decoder Block Architecture & Tensor Flow
Concept 02 Demo
Active Component
Multi-Head Self-Attention
Tensor Dimension Shape
(Batch, SeqLen=9, Dim=768)
Mathematical Role
Dynamic Context Mixing between Tokens