Skip to content
Cracked
AI
Problems
Tracks
Learn JAX
Roadmap
Articles
Leaderboard
Search
Ctrl K
Mode:
JAX
PyTorch
JAX
Python
Rust
C++
PyTorch
JAX
Python
Rust
C++
Log in
Sign up
Problems
Tracks
Learn JAX
Articles
Roadmap
Leaderboard
Set up the runtime
Log in
Sign up
PyTorch
JAX
Python
Rust
C++
Radio
We can't find the internet
Attempting to reconnect
Something went wrong!
Attempting to reconnect
Transformer practice problems in JAX
Search problems
Difficulty:
Easy
Medium
Hard
Category:
Primitives
Framework
End-to-End
Research
Tag:
transformer
training
classification
attention
basics
cnn
generative
activation
metrics
embedding
diffusion
llm
loss
normalization
optimization
causal-lm
ddpm
decoding
neural-network
regression
regularization
vit
bert
decoder
fine-tuning
inference
linear-algebra
mlm
nlp
position-encoding
preprocessing
rnn
seq2seq
sequence-model
softmax
tokenization
autograd
convolution
cross-attention
encoder-decoder
gpt
jax.grad
parameter-efficient
recurrent
rope
self-attention
sgd
training-loop
vae
adam
beam-search
bpe
broadcasting
calibration
distributed
efficiency
ema
feature-engineering
gates
gating
Show more tags
Sort:
Title
Easiest first
Hardest first
Recently added
Clear filters
Showing 26 of 26
Status
Title
Difficulty
Category
Tags
Adapter Layer
Medium
End-to-End
fine-tuning
parameter-efficient
transformer
ALiBi Position Bias
Medium
Research
alibi
position-bias
press-2022
attention
transformer
Causal LM Forward Pass
Medium
End-to-End
causal-lm
gpt
transformer
Causal Self-Attention Block
Medium
End-to-End
attention
transformer
causal
decoder
Cross Attention
Medium
Research
cross-attention
decoder
encoder-decoder
transformer
Cross-Attention Block
Medium
End-to-End
attention
cross-attention
transformer
Encoder-Decoder Transformer Forward Pass
Hard
End-to-End
seq2seq
transformer
encoder-decoder
GELU Activation
Easy
Research
gelu
activation
hendrycks-gimpel-2016
transformer
Grouped-Query Attention
Hard
Research
grouped-query-attention
gqa
ainslie-2023
attention
transformer
Implement Layer Normalization
Medium
Primitives
normalization
transformer
neural-network
Implement Positional Encoding
Hard
Primitives
transformer
positional-encoding
attention
Implement Scaled Dot-Product Attention
Hard
Primitives
attention
transformer
self-attention
KV Cache for Autoregressive Decoding
Hard
Research
kv-cache
autoregressive
decoding
inference
transformer
Learned Absolute Position Embedding
Easy
Primitives
embedding
position-encoding
transformer
MLM Forward Pass
Medium
End-to-End
mlm
bert
transformer
Multi-Head Attention Block
Hard
End-to-End
attention
transformer
multi-head
Multi-Query Attention
Medium
Research
multi-query-attention
mqa
shazeer-2019
attention
transformer
Patch Embedding with CLS Token
Medium
End-to-End
vit
transformer
embedding
Rotary Position Embeddings
Hard
Research
rope
rotary-embeddings
su-2021
position-encoding
transformer
Self-Attention Layer
Hard
End-to-End
self-attention
transformer
softmax
scaled-dot-product
Tied Input/Output Embeddings
Medium
Primitives
embedding
weight-tying
transformer
Transformer Block with RoPE
Hard
End-to-End
attention
transformer
rope
position-encoding
Transformer Decoder Block
Hard
End-to-End
transformer
decoder
causal-attention
cross-attention
Transformer Encoder Block
Hard
End-to-End
transformer
encoder
self-attention
layer-norm
ffn
ViT Classification Forward
Hard
End-to-End
vit
classification
transformer
ViT Encoder Block
Medium
End-to-End
vit
transformer
block