Dikun International
LOMONOSOV ZENIT 27B «ALTAY» holds 1,010,000 tokens of context literally — no retrieval, no summarisation, no offload to disk. On one RTX 5090.
An ordinary key–value cache at a million tokens would not fit in any consumer card. Here it is compressed to three bits by our own TurboQuant codec — 12,785 bytes per token, so the whole million lives in 13 gigabytes.
The weights are compressed unevenly, by what each part tolerates: text layers in four-bit NVFP4, attention in FP8, embeddings in eight bits. Twenty-seven billion parameters in 16.4 GiB, on disk and in memory alike.
| what | parameters |
|---|---|
| four-bit NVFP4 | 24,054,511,616 |
| eight-bit | 1,504,074,752 |
| FP8 attention, norms, biases | 1,716,395,256 |
| total | 27,274,981,624 |
Fourteen facts are planted at known depths in a corpus, then asked about one by one. Between thirty-three thousand tokens and a quarter of a million the curve is flat: an eightfold increase in length costs the model nothing.
The quarter-million figure is not a gift of the architecture but the result of work. RoPE frequency pairs are compressed in stages: pairs 15–21 of 32 by half above 196,608, the rest by a quarter above 262,144. That took retention from 71.4% to 92.9%, validated on a corpus the map was not chosen against, and repeated byte for byte. No training was required.
About the million, plainly. At full length the model finds two facts out of fourteen. The window is literal: the text goes in whole and the model answers from it — but we do not promise reliable retrieval across the whole million. The limit is architectural: 48 of the 64 layers carry a fixed-size state with no positions in it at all. Seven treatments have been tried and measured; the work continues.
RTX 5090, stock clocks, one sequence.
| context | read time | tokens/s |
|---|---|---|
| 131,072 | 34 s | 3840 |
| 262,144 | 109 s | 2400 |
| 524,288 | 6.4 min | 1375 |
| 1,010,000 | 22 min | 768 |
The slowdown with length is attention's quadratic cost rather than an implementation flaw: 381 seconds at 524,288 is faster than a pure quadratic extrapolation from 262,144.
No flags. The model looks at the memory actually free and takes the widest window that will genuinely start — and writes its choice to the log in one line.
| card | free | window |
|---|---|---|
| RTX 5090, nothing else running | 32 GB | 1,010,001 |
| RTX 5090 with a desktop session | −0.7 GB | 393,216 |
| RTX 4090 | 24 GB | 262,144 |
The thresholds are measured, not estimated: memory was held by another process at nine levels, and at each one the bare command was given. There is no level at which the model would choose a window and then fail to start.
A receipts/
folder ships with the model. Each receipt records the question it was answering,
the hardware, the runtime version — and what it does not establish. The
probes that produced the numbers on this page sit next to them and run with one
command.
The rule is simple: no figure enters the card without a receipt. Where a measurement has refuted something published earlier, a dated correction stands in its place with the old value, so it is visible what changed and why.
A card with compute capability 8.9 or above — 5090, 4090, L40S, L4. It will not load on Ampere or older: the FP8 scheme requires it. GGUF and Ollama are not supported. The first run on a new machine compiles FP4 kernels for your card, about four minutes, once.
Ddavidich/LOMONOSOV-ZENIT-27B-1M-INDEV · receipts · full model card
Every number on this page was measured on a rented RTX 5090 at stock clocks. Where a figure here disagrees with a receipt, the receipt is right.
Dikun International
LOMONOSOV ZENIT 27B «ALTAY» держит контекст в 1 010 000 токенов дословно — без поиска по базе, без конспектирования, без выгрузки на диск. На одной RTX 5090.
Обычный кэш ключей и значений на миллионе токенов не поместился бы ни в одну потребительскую карту. Здесь он сжат до трёх бит собственным кодеком TurboQuant — 12 785 байт на токен, то есть весь миллион укладывается в 13 гигабайт.
Веса сжаты неравномерно, по тому, что каждая часть выдерживает: текстовые слои в NVFP4 по четыре бита, внимание в FP8, эмбеддинги в восемь бит. Двадцать семь миллиардов параметров — 16.4 ГиБ и на диске, и в памяти.
| что | параметров |
|---|---|
| четырёхбитные NVFP4 | 24 054 511 616 |
| восьмибитные | 1 504 074 752 |
| внимание FP8, нормировки, смещения | 1 716 395 256 |
| всего | 27 274 981 624 |
В корпус на известной глубине кладутся четырнадцать закладок, потом про каждую задаётся вопрос. Между тридцатью тремя тысячами токенов и четвертью миллиона кривая плоская: восьмикратный рост длины не стоит модели ничего.
Уровень на четверти миллиона — не подарок архитектуры, а результат работы. Частотные пары RoPE сжимаются ступенчато: пары 15–21 из 32 вдвое выше 196 608, остальные вчетверо выше 262 144. Это подняло удержание с 71.4% до 92.9%, проверено на корпусе, по которому карта не подбиралась, и повторено побайтово. Обучения не потребовалось.
О миллионе прямо. На полной длине модель находит две закладки из четырнадцати. Окно буквальное: текст входит целиком и модель по нему отвечает — но надёжного поиска по всему миллиону мы не обещаем. Предел архитектурный: 48 слоёв из 64 несут состояние фиксированного размера, у которого позиций нет вовсе. Семь способов лечения проверены и замерены; работа продолжается.
RTX 5090, заводские частоты, одна последовательность.
| контекст | время чтения | токенов/с |
|---|---|---|
| 131 072 | 34 с | 3840 |
| 262 144 | 109 с | 2400 |
| 524 288 | 6.4 мин | 1375 |
| 1 010 000 | 22 мин | 768 |
Замедление с длиной — квадратичная цена внимания, а не изъян реализации: 381 секунда на 524 288 быстрее, чем даёт чистая квадратичная экстраполяция от 262 144.
Никаких флагов. Модель смотрит на фактически свободную память и берёт самое широкое окно, которое действительно поднимется, — а выбор пишет в лог одной строкой.
| карта | свободно | окно |
|---|---|---|
| RTX 5090, ничем не занята | 32 ГБ | 1 010 001 |
| RTX 5090 с рабочим столом | −0.7 ГБ | 393 216 |
| RTX 4090 | 24 ГБ | 262 144 |
Пороги не оценены, а замерены: память удерживалась чужим процессом на девяти уровнях, и на каждом давалась голая команда. Уровня, при котором модель выбрала бы окно и не поднялась, не осталось.
С моделью едет папка receipts/.
В каждой квитанции записано, на какой вопрос она отвечала, на каком железе снята,
какая версия рантайма стояла — и чего эта квитанция не устанавливает.
Пробы, которыми сняты числа с этой страницы, лежат рядом и запускаются одной
командой.
Правило простое: в карточку не попадает цифра без квитанции. Там, где замер опроверг ранее опубликованное, стоит датированная поправка с прежним значением — чтобы видно было, что именно изменилось и почему.
Видеокарта с compute capability 8.9 и выше — 5090, 4090, L40S, L4. На Ampere и старше не загрузится: этого требует схема FP8. Формат GGUF и Ollama не поддерживаются. Первый запуск на новой машине собирает ядра FP4 под вашу карту, около четырёх минут, один раз.
Ddavidich/LOMONOSOV-ZENIT-27B-1M-INDEV · квитанции · полная карточка
Все числа на этой странице замерены на арендованной RTX 5090 на заводских частотах. Если число здесь расходится с квитанцией — верна квитанция.