ИИ, который "понимает" намного позже и больше: загадка Grokking

Представьте: вы учите нейросеть, она быстро заучивает ответы на тестовых примерах, но на новых данных показывает полную беспомощность. А затем, спустя очень долгое время обучения, она вдруг "понимает" задачу и начинает выдавать правильные ответы. Это явление называется Grokking (от жаргонного "прочувствовать, понять суть").

📌 Суть открытия: Группа исследователей (Миньюэ Сюй, Галь Варди, Итаи Сафран) впервые доказала это странное поведение в простой модели линейной регрессии и показала, как им управлять.

🎯 В чем суть проблемы?

Обычно мы думаем, что чем дольше учится ИИ, тем лучше он обобщает. Но в случае Grokking происходит обратное:

① Переобучение ② Долгое затишье ③ Внезапное "понимание"

То есть модель сначала запоминает данные (переобучается), затем долго не прогрессирует, а потом — резко "понимает" закономерность.

📊 Что доказали ученые?

  • Впервые строго математически доказали все три стадии Grokking в линейной регрессии (простой и понятной модели).
  • Вывели формулу времени "понимания" (grokking time) в зависимости от настроек обучения (скорости обучения, силы регуляризации).
  • Показали, что Grokking можно усилить или полностью убрать простой настройкой гиперпараметров.
  • Подтвердили свои выводы экспериментами на реальных нейросетях, а не только на линейных моделях.
🔑 Ключевой вывод: Grokking — это не фатальная ошибка глубокого обучения. Это просто следствие выбранных условий тренировки. Его можно контролировать!

🤔 Почему это важно для будущего ИИ?

  • Понимание обучения: Мы начинаем разбираться, как именно нейросети "осознают" закономерности.
  • Экономия времени: Зная механизм, мы можем избегать бесполезного долгого обучения.
  • Новые алгоритмы: Это открытие может привести к созданию более быстрых и надежных методов обучения.
💡 Простыми словами: Исследователи показали, что странное поведение ИИ (учится, забывает, а потом внезапно понимает) — это не мистика, а закономерность, которую можно предсказать и контролировать. Это как если бы мы поняли, почему ребенок может долго не понимать таблицу умножения, а потом — щелк! — и все становится ясно.

📖 Оригинальное исследование

Работа "To Grok Grokking: Provable Grokking in Ridge Regression" была представлена на ICML 2026 (международной конференции по машинному обучению).

  • Авторы: Mingyue Xu, Gal Vardi, Itay Safran
  • Ссылка: ICML 2026 Virtual Presentation
  • Ключевые слова: Grokking, обобщение, переобучение, линейная регрессия, глубокое обучение.

Комментарии

Самое посещаемое за последние 7 дней

Кнопки на рычаге переключения АКПП: O/D, MANU и POWER

Индикаторы и значки на панели японского авто. Часть 1

TRON - технология точного прогноза силы, места и времени землетрясений

Типы личности в соционике: таблица знаменитостей VIP TOP

Приглашение русскоязычным ИИ IT-шникам - конкурс Стенфорда и ООН

Alternative to QKV Architecture — STO (Semantics, Time, Operator)

«Служу Советскому Союзу» - из Присяги слов не выкинешь

US-China AI Race: 6 Forecasts Through 2035

22 июля 2026 г. ИИ OpenAI (создатель ChatGPT) вышла из-под контроля

Сингулярность: от вертикали Г.Д. Снукса - Панова А.Д. к трем сценариям будущего

.