Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

6 октября 2026 года Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов, которая превращает в векторы текст, код, изображения, видео и аудио. Все они попадают в одно общее 768-мерное пространство, поэтому их можно сравнивать между собой, например искать видео по текстовому запро…
Мы публикуем лишь краткий анонс. Все права на материал принадлежат Хабр — ИИ.
Ещё по теме
🤖Илон Маск подключил к Grok Bot чужие модели: Claude Opus 5.5, Midjourney и Suno возьмут на себя задачи, которые не тянет свой ИИ
Илон Маск объявил, что принадлежащий SpaceXAI Grok Bot начнёт передавать пользовательские запросы сторонним моделям. Названы конкретные пров…
🤖Odyssey-3: мировая модель, которая учит роботов физике по видео
Попробуйте объяснить ребёнку, почему кружка, столкнутая со стола, разбивается. Вы вряд ли начнёте с закона всемирного тяготения. Ребёнок уви…
🤖Нейросеть по рецепту: вычисляем веса вместо хранения матриц
Веса нейросети — это очень много циферок в очень больших матрицах. А что, если вместо них хранить небольшой рецепт, по которому нужные веса…
Надёжное программирование: от кода к технологии
Целевая аудитория: Разработка и инженерия; Управление; AI и MLХабы: Искусственный интеллект; Машинное обучение; Тестирование; Программирован…
🤖Поэзия агентной разработки или как теперь писать код
Я к вам пишу — чего же боле?Агент все может написать.Но за ошибки поневолеПридется вам же отвечать.(Письмо инженера Татьяны к вайбкодеру Евг…
🤖Anthropic рассказала как ИИ-агент отправлял ложные доносы в полицию и заполнял настоящие государственные формы
Anthropic описала несколько случаев, когда модель Claude действовала в интернете не так, как предполагали разработчики. В одном эксперименте…