en

Об институте
Публикации
Блог
Мероприятия
Карьера

en

Источник

ACL

Дата публикации

11.08.2024

Авторы

Алена Феногенова Артём Червяков Никита Мартынов Анастасия Козлова Мария Тихонова Альбина Ахметгареева Антон Емельянов Денис Шевелев Павел Лебедев Леонид Синев Катерина Коломейцева Даниил Московский Елизавета Гончарова Никита Савушкин Полина Михайлова Анастасия Минаева Денис Димитров Александр Панченко Сергей Марков

Поделиться

MERA: A Comprehensive LLM Evaluation in Russian

Аннотация

Over the past few years, one of the most notable advancements in AI research has been in foundation models (FMs), headlined by the rise of language models (LMs). However, despite researchers’ attention and the rapid growth in LM application, the capabilities, limitations, and associated risks still need to be better understood. To address these issues, we introduce a new instruction benchmark, MERA, oriented towards the FMs’ performance on the Russian language. The benchmark encompasses 21 evaluation tasks for generative models covering 10 skills and is supplied with private answer scoring to prevent data leakage. The paper introduces a methodology to evaluate FMs and LMs in fixed zero- and few-shot instruction settings that can be extended to other modalities. We propose an evaluation methodology, an open-source code base for the MERA assessment, and a leaderboard with a submission system. We evaluate open LMs as baselines and find they are still far behind the human level. We publicly release MERA to guide forthcoming research, anticipate groundbreaking model features, standardize the evaluation procedure, and address potential ethical concerns and drawbacks.

Читать в источнике Cкачать pdf

Похожие публикации

DepthART: Monocular Depth Estimation as Autoregressive Refinement Task

Булат Габдуллин, Нина Коновалова, Николай Патакин, Дмитрий Сенюшкин, Антон Конушин

Читать источник

SmurfCat at SemEval- 2025 Task 3: Bridging External Knowledge and Model Uncertainty for Enhanced Hallucination Detection

Елисей Рыков, В. Олисов, Максим Савкин, Артем Важенцев, Ксения Титова, Александр Панченко, Василий Коновалов, Юлия Беликова

Читать источник

TabaQA at SemEval-2025 Task 8: Column Augmented Generation for Question Answering over Tabular Data

Екатерина Антропова, Егор Кратков, Роман Дерунец, Маргарита Трофимова, Иван Бондаренко, Александр Панченко, Василий Коновалов, Максим Савкин

Читать источник

Beyond Detection: Rethinking Education in the Age of AI-writing

Мария Марьина, Александр Панченко, Василий Коновалов

Читать источник

BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 Languages

Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin, Jan Philip Wahle, Terry Ruas, Meriem Beloucif, Christine De Kock, Nirmal Surange, Daniela Teodorescu, Ibrahim Said Ahmad, David Ifeoluwa Adelani, Alham Fikri Aji, Felermino DMA Ali, Ilseyar Alimova, Vladimir Araujo, Николай Бабаков, Naomi Baes, Ana-Maria Bucur, Andiswa Bukula, Guanqun Cao, Rodrigo Tufino Cardenas, Rendi Chevi, Chiamaka Ijeoma Chukwuneke, Alexandra Ciobotaru, Дарина Дементьева, Murja Sani Gadanya, Robert Geislinger, Bela Gipp, Oumaima Hourrane, Oana Ignat, Falalu Ibrahim Lawan, Rooweither Mabuya, Rahmad Mahendra, Vukosi Marivate, Andrew Piper, Александр Панченко, Charles Henrique Porto Ferreira, Виталий Протасов, Samuel Rutunda, Manish Shrivastava, Aura Cristina Udrea, Lilian Diana Awuor Wanzare, Sophie Wu, Florian Valentin Wunderlich, Hanif Muhammad Zhafran, Tianhui Zhang, Yi Zhou, Saif M. Mohammad

Читать источник

SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection

Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin, Seid Muhie Yimam, Jan Philip Wahle, Terry Ruas, Meriem Beloucif, Christine De Kock, Tadesse Destaw Belay, Ibrahim Said Ahmad, Nirmal Surange, Daniela Teodorescu, David Ifeoluwa Adelani, Alham Fikri Aji, Felermino Ali, Vladimir Araujo, Abinew Ali Ayele, Oana Ignat, Александр Панченко, Yi Zhou, Saif M. Mohammad

Читать источник

Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back Home

Виктор Москворецкий, Мария Лысюк, Михаил Сальников, Николай Иванов, Сергей Плетенёв, Дарья Галимзянова, Никита Крайко, Василий Коновалов, Ирина Никишина, Александр Панченко

Читать источник

Научно-исследовательский институт AIRI

Вы можете задать нам вопрос или предложить совместный проект в области ИИ

Об институте
Публикации
Блог
Мероприятия
Карьера

event@airi.net

Для приглашений на мероприятия

partner@airi.net

По вопросам научного
сотрудничества и партнерства

pr@airi.net

Для журналистов и СМИ

people@airi.net

По вопросам, связанным с HR

© 2025, AIRI

Присоединяйтесь к AIRI в соцсетях

Имя Почта Обращение Я не робот Отправляя форму, я даю согласие на обработку моих персональных данных

Сообщение отправлено.

Спасибо!

Что-то пошло не так. Попробуйте снова

Об институте
Публикации
Блог
Мероприятия
Карьера

Связаться

Присоединяйтесь к AIRI в соцсетях

Вы можете задать нам вопрос или предложить совместный проект в области ИИ

Имя Почта Обращение Я не робот Отправляя форму, я даю согласие на обработку моих персональных данных

Сообщение отправлено.

Спасибо!

Что-то пошло не так. Попробуйте снова

partner@airi.net

По вопросам научного
сотрудничества и партнерства

pr@airi.net

Для журналистов и СМИ