▲ 1 Training a 1.93B byte-level LM on one A100: 60K steps, flat to 4x context (huggingface.co) by EverestAn | Oct 7, 2026 | 0 comments on HN Visit Link