en

Об институте
Публикации
Блог
Мероприятия
Карьера

en

Источник

CLEF / PAN

Дата публикации

15.08.2024

Авторы

Сергей Плетенёв

Поделиться

SomethingAwful at PAN 2024 TextDetox: Uncensored Llama 3 Helps to Censor Better.

PAN2024, Multilingual Detoxification, NLP, LLM, Refusals, Model Jailbreak

Аннотация

In this paper, we report on our system for Multilingual Text Detoxification Task at PAN 2024. In this task, we needed to detoxify a multilingual corpus of texts. We propose an approach based on a large language models based onLlama3architecture with an additional method for jailbreaking model generation refusals. Our approach shows an advantage over Human References for multiple languages in manual evaluation, and outperforms baselines in automatic detoxification benchmark. Our work contributes to the ongoing effort to assess the vulnerability of LLMs to jailbreaking attacks, underscoring the latent capabilities of the large models.

Cкачать pdf

Похожие публикации

FactDebug at SemEval-2025 Task 7: Hybrid Retrieval Pipeline for Identifying Previously Fact-Checked Claims Across Multiple Languages

Евгений Николаев, Иван Бондаренко, Ислам Аушев, Василий Крикунов, Андрей Глинский, Василий Коновалов, Юлия Беликова

Читать источник

SmurfCat at SemEval- 2025 Task 3: Bridging External Knowledge and Model Uncertainty for Enhanced Hallucination Detection

Елисей Рыков, В. Олисов, Максим Савкин, Артем Важенцев, Ксения Титова, Александр Панченко, Василий Коновалов, Юлия Беликова

Читать источник

TabaQA at SemEval-2025 Task 8: Column Augmented Generation for Question Answering over Tabular Data

Екатерина Антропова, Егор Кратков, Роман Дерунец, Маргарита Трофимова, Иван Бондаренко, Александр Панченко, Василий Коновалов, Максим Савкин

Читать источник

Beyond Detection: Rethinking Education in the Age of AI-writing

Мария Марьина, Александр Панченко, Василий Коновалов

Читать источник

Uncertainty Quantification for Large Language Models

Артем Шелманов, Максим Панов, Roman Vashurin, Артем Важенцев, Екатерина Фадеева, Timothy Baldwin

Читать источник

BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 Languages

Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin, Jan Philip Wahle, Terry Ruas, Meriem Beloucif, Christine De Kock, Nirmal Surange, Daniela Teodorescu, Ibrahim Said Ahmad, David Ifeoluwa Adelani, Alham Fikri Aji, Felermino DMA Ali, Ilseyar Alimova, Vladimir Araujo, Николай Бабаков, Naomi Baes, Ana-Maria Bucur, Andiswa Bukula, Guanqun Cao, Rodrigo Tufino Cardenas, Rendi Chevi, Chiamaka Ijeoma Chukwuneke, Alexandra Ciobotaru, Дарина Дементьева, Murja Sani Gadanya, Robert Geislinger, Bela Gipp, Oumaima Hourrane, Oana Ignat, Falalu Ibrahim Lawan, Rooweither Mabuya, Rahmad Mahendra, Vukosi Marivate, Andrew Piper, Александр Панченко, Charles Henrique Porto Ferreira, Виталий Протасов, Samuel Rutunda, Manish Shrivastava, Aura Cristina Udrea, Lilian Diana Awuor Wanzare, Sophie Wu, Florian Valentin Wunderlich, Hanif Muhammad Zhafran, Tianhui Zhang, Yi Zhou, Saif M. Mohammad

Читать источник

SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection

Shamsuddeen Hassan Muhammad, Nedjma Ousidhoum, Idris Abdulmumin, Seid Muhie Yimam, Jan Philip Wahle, Terry Ruas, Meriem Beloucif, Christine De Kock, Tadesse Destaw Belay, Ibrahim Said Ahmad, Nirmal Surange, Daniela Teodorescu, David Ifeoluwa Adelani, Alham Fikri Aji, Felermino Ali, Vladimir Araujo, Abinew Ali Ayele, Oana Ignat, Александр Панченко, Yi Zhou, Saif M. Mohammad

Читать источник

Научно-исследовательский институт AIRI

Вы можете задать нам вопрос или предложить совместный проект в области ИИ

Об институте
Публикации
Блог
Мероприятия
Карьера

event@airi.net

Для приглашений на мероприятия

partner@airi.net

По вопросам научного
сотрудничества и партнерства

pr@airi.net

Для журналистов и СМИ

people@airi.net

По вопросам, связанным с HR

© 2025, AIRI

Присоединяйтесь к AIRI в соцсетях

Имя Почта Обращение Я не робот Отправляя форму, я даю согласие на обработку моих персональных данных

Сообщение отправлено.

Спасибо!

Что-то пошло не так. Попробуйте снова

Об институте
Публикации
Блог
Мероприятия
Карьера

Связаться

Присоединяйтесь к AIRI в соцсетях

Вы можете задать нам вопрос или предложить совместный проект в области ИИ

Имя Почта Обращение Я не робот Отправляя форму, я даю согласие на обработку моих персональных данных

Сообщение отправлено.

Спасибо!

Что-то пошло не так. Попробуйте снова

partner@airi.net

По вопросам научного
сотрудничества и партнерства

pr@airi.net

Для журналистов и СМИ