Чому я вірю в автономних агентів: кейс з агентом ChatGPT
OpenAI намагається хоч якось згладити сумнівний запуск GPT-5. Вже повернули доступ до GPT-4o і дали можливість самостійно вибирати режим роботи GPT-5 (авто, ручний, роздуми). Сподіваюся, найближчим часом їм вдасться усунути решту недоробок. Але в мене сьогодні розповідь буде не про це. Я поділюся цікавим кейсом, який наочно демонструє, чому я так сильно вірю в автономних агентів.
Зайшов я нещодавно до ChatGPT із запитом візуалізувати статистику учасників IronMan 70.3 за часом завершення дистанції. GPT-4o пошукав в інтернеті та люб’язно надав мені статистику за найкращими 24 учасниками. Я наполегливо попросив розширити її на всіх учасників. Але GPT-4o не вдалося знайти повних даних в інтернеті. Натомість він знайшов сайт із потрібною мені статистикою, відображеною у вигляді частотної діаграми. І запропонував мені поклікати на всі стовпчики, виписати значення в підготовлену ним табличку, і тоді він мені все гарно оформить. :)
До такої вправи я не був готовий. Увімкнув режим агента і запропонував йому самому закінчити розпочате. І тут почалося найцікавіше. Агент відкрив потрібний сайт у браузері, легко впорався з рекламою, що випадає, і фільтрами для відображення потрібної статистики. Отримав діаграму та почав намагатися клікати на стовпчики. А стовпчики всі різної висоти, тоненькі, і деякі дуже низькі. Навіть людині важко клікнути на деякі з них.
Він довго й ретельно клікав, доки дійшов до одного дуже складного стовпчика. Зробив 5 спроб, і не вдалося клікнути на нього. Тоді він плюнув на такий підхід і вирішив пошукати дані для стовпчиків у коді HTML-сторінки. Визначив, на що зав’язатися, і знайшов у коді, де здійснювалася прив’язка даних. Але дані підвантажувалися динамічно, і він вирішив повернутися назад до клацань на стовпчики діаграми. Цього разу він зміг пройтися всіма стовпчиками, використовуючи техніку кліку біля основи стовпчика.
А далі він вирішив, що було б круто перевірити ці дані, оскільки є ризик, що він десь помилився з кліком. Тому він повернувся до коду сторінки і знайшов JS-код, де динамічно підвантажувалися дані. Далі він написав схожий Python-код і використав усі cookies із браузера. Отримав повні дані, звірив їх з отриманими з діаграми і сміливо сформував мені потрібний звіт.
Що мене особливо здивувало й потішило в цьому кейсі:
- завзятість, з якою агент вирішував завдання;
- різноманітність використаних технік та інструментів;
- класний ланцюжок роздумів, кращий, ніж у більшості людей;
- самоконтроль і повторна перевірка ризикованих даних.
А які цікаві завдання ви вирішували за допомогою агента в ChatGPT?