Google показала, как экономить на обучении моделей, и это работает!
🚀 Google показала, как экономить на обучении моделей, и это работает!
Google DeepMind взяла уже существующую модель Gemma 4 и превратила её в диффузионную, не начиная обучение с нуля. Это как взять старый велосипед и превратить его в электробайк, потратив на это менее 10% от первоначального бюджета. Результат? DiffusionGemma теперь генерирует 256 токенов одновременно, а не по одному, как раньше. Это даёт ей скорость около 1 500 токенов в секунду — почти как Cheetah на стероидах!
Однако, несмотря на все эти улучшения, DiffusionGemma всё же уступает оригинальной авторегрессивной модели по качеству. Особенно заметно это на задачах, требующих логического мышления. Казалось бы, всё прекрасно, но есть над чем поработать.
◾️ Токены: 256 одновременно
◾️ Скорость: 1 500 токенов в секунду
◾️ Бюджет: менее 10% от оригинального
> «Оказывается, велосипед можно не только починить, но и прокачать до уровня электробайка!»
Интересно, что получится, если прокачать её до 20% бюджета?
Подписаться на «Нейро Пульс»
Первоисточник ↗
Google DeepMind взяла уже существующую модель Gemma 4 и превратила её в диффузионную, не начиная обучение с нуля. Это как взять старый велосипед и превратить его в электробайк, потратив на это менее 10% от первоначального бюджета. Результат? DiffusionGemma теперь генерирует 256 токенов одновременно, а не по одному, как раньше. Это даёт ей скорость около 1 500 токенов в секунду — почти как Cheetah на стероидах!
Однако, несмотря на все эти улучшения, DiffusionGemma всё же уступает оригинальной авторегрессивной модели по качеству. Особенно заметно это на задачах, требующих логического мышления. Казалось бы, всё прекрасно, но есть над чем поработать.
◾️ Токены: 256 одновременно
◾️ Скорость: 1 500 токенов в секунду
◾️ Бюджет: менее 10% от оригинального
> «Оказывается, велосипед можно не только починить, но и прокачать до уровня электробайка!»
Интересно, что получится, если прокачать её до 20% бюджета?
Пока нет комментариев — будьте первым.