Papers tagged “transformer”
19 papers · All papers →
-
Mixtral of Experts
-
Fast Inference from Transformers via Speculative Decoding
-
FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
-
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
-
Scalable Diffusion Models with Transformers
-
Decision Transformer: Reinforcement Learning via Sequence Modeling
-
Emerging Properties in Self-Supervised Vision Transformers
-
Masked Autoencoders Are Scalable Vision Learners
-
RoFormer: Enhanced Transformer with Rotary Position Embedding
-
Swin Transformer: Hierarchical Vision Transformer using Shifted Windows
-
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
-
An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale
-
End-to-End Object Detection with Transformers
-
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
-
Language Models are Few-Shot Learners
-
Language Models are Unsupervised Multitask Learners
-
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
-
Improving Language Understanding by Generative Pre-Training
-
Attention Is All You Need