Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator
Related stories
The State Of LLMs 2025: Progress, Problems, and Predictions
A 2025 review of large language models, from DeepSeek R1 and RLVR to inference-time scaling, benchmarks, architectures, and predictions for 2026.
Accelerating Protein Language Model ProtST on Intel Gaudi 2
Very Large Language Models and How to Evaluate Them
Evaluating large language models trained on code
Introducing The World's Largest Open Multilingual Language Model: BLOOM
Accelerating vision-language models with LFM2.5-VL-DSpark
Matryoshka Language Model Suites
arXiv:2608. 09703v1 Announce Type: new Abstract: Training a language model suite classically requires training each model separately and serving them independently.
Red-Teaming Large Language Models
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
Decoder-only language models entangle long-term memory and reasoning in a single parameter set, making it difficult to scale memory capacity independently. Memory Decoder introduces a parametric long-term memory module but only studies it at a relatively small scale.
Zipbench: Low-Cost Framework for Compressing Comprehensive Benchmarks of Large Language Models
arXiv:2609.12475v1 Announce Type: new Abstract: Comprehensive benchmark suites are essential for improving large language models (LLMs), but many widely used benchmarks are redundant, making evaluati...
