Дорожная карта участия в соревнование ООН по AI 1 - 2.1

SimulacraBench — соревнование ООН по улучшению точности социологических опросов через AI.

Задача: Предсказывать вероятности ответов респондентов на вопросы, которые им не задавали или на которые они не ответили.

Формат:

  • 3 датасета: UNICEF, World Bank, UNHCR
  • Каждый датасет — таблица "респондент × вопрос"
  • Видим только часть ответов (GIVEN), должны предсказать скрытые (PREDICT)
  • Метрика: Skill (0 = случайное угадывание, 1 = идеал)

Призы: Не указаны в README, но это престижное соревнование от ООН + Stanford.

Почему это важно?

Это не просто "заполнить пропуски". Это про то, как сделать опросы дешевле и точнее, предсказывая ответы тех, кто не ответил, или кому не задали вопрос из-за логики опроса (gate).


🗺️ РАЗДЕЛ 2: КАРТА МИРА

Структура проекта

SituatedEvals/public/
├── data/
│   ├── sample.json          # Тестовая схема (400 респондентов)
│   ├── unicef.json          # Реальная схема UNICEF
│   ├── world_bank.json      # Реальная схема World Bank
│   └── unhcr.json           # Реальная схема UNHCR
├── baseline/
│   ├── marginal_counts/     # Бейзлайн: маргинальные частоты
│   └── bundled_artifact/    # Пример загрузки весов
├── tutorials/
│   ├── ru.ipynb             # Туториал на русском
│   └── en.ipynb             # Туториал на английском
├── tools/
│   └── check_submission_zip.py  # Валидатор архива
├── make_sandbox.py          # Генератор песочницы
├── score.py                 # Локальный скоринг
├── config.yml               # Конфигурация (лимиты, фазы)
└── requirements.txt         # Зависимости

Ключевые файлы (приоритет изучения)

  1. config.yml — лимиты времени, памяти, правила фаз
  2. data/*.json — схемы опросов (структура вопросов, gate-логика)
  3. baseline/marginal_counts/main.py — минимальный рабочий шаблон
  4. tutorials/ru.ipynb — объяснение механики на примере

Фазы соревнования

Phase 1 (Development):

  • Доступны: TRAIN (с ответами), DEV (только GIVEN)
  • Лидерборд: шумный (Laplace noise)
  • Попытки: 1 в день
  • Таймер: 900 секунд на все 3 датасета

Phase 2 (Final):

  • Доступны: TRAIN + DEV (оба с ответами), TEST (только GIVEN)
  • Лидерборд: точный
  • Попытки: 1 за всё время
  • Таймер: 3600 секунд

📍 РАЗДЕЛ 3: ТЕКУЩАЯ ТОЧКА (День 3)

Где мы сейчас:

  • ✅ Репозиторий склонирован
  • ✅ Зависимости установлены
  • ✅ Песочница сгенерирована
  • Следующий шаг: Первый сабмит бейзлайна на Codabench

Что уже знаем:

  • Структура данных изучена (схемы data/*.json)
  • Понимаем контракт predict(frame, schema)
  • Знаем про gate-логику (skip patterns)
  • Понимаем метрику Skill

Что НЕ знаем:

  • Реальное качество бейзлайна на лидерборде
  • Насколько шумный лидерборд в Phase 1
  • Какие gate-правила дают максимальный прирост


Комментарии

Самое посещаемое за последние 7 дней

Кнопки на рычаге переключения АКПП: O/D, MANU и POWER

Ищу соучредителя в проект мирового значения с €200 000

Одна из ИИ моделей OpenAI (создатель ChatGPT) успешно вышла из-под контроля людей

Оригинальный подарок на день рождение. Недорогой и полезный

Белоснежка и Черноглазка тестируют волшебную палочку в «Лавке сокровищ»

Типы личности в соционике: таблица знаменитостей VIP TOP

Вопросы ИИ о технологии точного прогноза землетрясений «TRON»

Liberatus AI - следующая спираль разума.

TRON - технология точного прогноза силы, места и времени землетрясений

«Служу Советскому Союзу» - из Присяги слов не выкинешь

.