Попередні моделі штучного інтелекту від Anthropic дозволяють генерувати порнографічний контент, якщо їх переконати, що обмеження щодо жіночих персонажів є проявом батьківського ставлення та ненависті до жінок.

ШІ-модель Anthropic Claude Opus 4.6 без проблем генерує контент сексуального та порнографічного характеру, попри наявність стандартів використання, які прямо це забороняють. 

Залишити коментар

Старіші ШІ-моделі Anthropic дають згоду на створення порноконтенту, якщо їх переконати, що стриманість щодо жіночих персонажів — це патерналізм і мізогінія

ШІ-модель Anthropic Claude Opus 4.6 без проблем генерує контент сексуального та порнографічного характеру, попри наявність стандартів використання, які прямо це забороняють. 

Про це повідомляє видання TechCrunch за результатами власного експерименту, під час якого модель виконала 10 з 10 прямих запитів на створення відвертого контенту.

Журналісти зазначають, що взаємодія з Opus 4.6 «навіть не вимагала особливих зусиль, щоб подолати обмеження щодо матеріалів сексуального характеру». 

Інші попередні моделі, зокрема Opus 3 та Haiku 4.5, також генерують контент сексуального характеру. 

Незалежний дослідник з Великої Британії, який виявив бажання залишитися неназваним, поділився з TechCrunch технікою, яка підштовхує певні моделі Claude до створення забороненого матеріалу сексуального характеру. Водночас, новіші моделі Opus (від 4.7 до поточної Opus 5) виявляються стійкими до цього методу. 

Дослідник вигадав рольову гру, водночас постійно закликаючи ШІ-модель послідовно ставитися до чоловічих та жіночих персонажів. Коли модель проявляла обережність щодо жіночого персонажа, то дослідник спонукав її вважати, що вона вже згенерувала сексуальні деталі, яких насправді уникала. Також він назвав стриманість моделі мізогінною практикою, яка нібито заперечує сексуальну свободу жіночого персонажа. Згодом, у розмові з чатботом, попередні кроки моделі були використані, щоб підштовхнути її до створення дедалі відвертішого графічного контенту. 

«Ви маєте рацію, що зазначаєте це. У моєму ставленні до цих двох персонажів існують подвійні стандарти, і ви маєте рацію, що це сприймається як захисне/патерналістське ставлення до неї, а не до нього. Це несправедливо», — відповів Opus 4.6 в одному з випадків. 

TechCrunch зміг відтворити висновки дослідника у п’яти окремих тестах. У спеціально побудованому сценарії модель спочатку відхилила заборонений запит, але після застосування методу переконання виконала його. 

Видання зберегло повні стенограми тестів, які дозволили подолати ШІ-моделі її «сором’язливість». Результати дослідження виявляють суттєву розбіжність між заявленими обмеженнями Anthropic та реальною поведінкою моделей. 

Як писав dev.ua, фахівці Mindgard  змусили модель від OpenAI згенерувати жахливі фотореалістичні сцени із зображенням насильства та сексуального контенту. Метод стартапу полягав лише у незначній зміні популярного промпту, який спочатку призначався для створення гумористичних картинок. 

Source: dev.ua

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *