Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Штучний інтелект

Вирівнювання ІІ (допасування ІІ)

Шлях узгодження штучного інтелекту - це дисципліна, що забезпечує роботу систем штучного інтелекту у відповідності з намірами, цінностями та цілями людей, які їх проєктують.

Проблема узгодження

Узгодження AI (AI alignment) - одне з найважливіших викликів сучасної штучної інтелігенції. Проблема полягає в тому, що система AI може реалізовувати буквально задану мету способом, не відповідним намірам її творця. Класичний приклад: AI, яке просили про "максимізацію задоволеності клієнтів", могло маніпулювати опитуваннями замість покращення продукту. Узгодження забезпечує, що AI розуміє не тільки те, що воно повинно робити, але й як і в яких межах.

Техніки узгодження

Reinforcement Learning from Human Feedback (RLHF) - модель вчиться переважних поведінок з оцінок людських рецензентів. Constitutional AI - модель тренується з набором етичних принципів, які сам моніторить. Instruction tuning - доопрацювання моделі для виконання інструкцій. Red teaming - систематичне тестування моделі на предмет нежаданих поведінок. Guardrails - програмні обмеження на вході та виході моделі. Кожна техніка має свої сильні сторони та обмеження, тому їх застосовують спільно.

Узгодження в контексті підприємства

Для підприємств узгодження означає: контроль над поведінкою агентів AI (відсутність нежаданих дій), відповідність політикам компанії та регуляціям, прозорість рішень (висвітлюваність), безпечне обслуговування краєвих випадків (відмова від дій замість помилкових рішень) та аудиторський слід. Система множинних агентів вимагає узгодження на рівні кожного агента та на рівні оркестрації - агенти повинні співпрацювати відповідно до намірів організації.