Чому AI сповільнив досвідчених розробників у дослідженні METR
Уже тиждень бачу в різних місцях посилання на результати експерименту з вимірювання впливу AI-інструментів на ефективність розробки. І майже при кожній згадці посил такий: «Ха-ха, насправді AI-інструменти не пришвидшують, а сповільнюють розробку. Шах і мат, фанати AI!». І справді, якщо побіжно переглянути статтю, то запам’ятовується висновок «очікували пришвидшення на 20–40%, а отримали сповільнення на 19%».
Але якщо почитати уважніше, вникнувши в суть експерименту та механіку його проведення, то результати стають досить зрозумілими і навіть очевидними. Серед найвпливовіших факторів виділено такі:
- Дуже великий досвід роботи з репозиторіями в учасників експерименту. Вони фактично почувалися як риба у воді з будь-якою задачею і точно знали, як її треба вирішувати.
- Великі та складні репозиторії. Середній вік репозиторію — 10 років, розмір — 1 млн рядків коду.
- Слабке використання неявного контексту задачі та ключових знань про репозиторій. Розробники покладалися на автоматичний аналіз і формування контексту AI-інструментами.
Ці фактори чудово демонструють цілком очікувану реальність: якщо роками люди накопичували в голові знання про щось нетривіальне, то без формалізації цих знань і надання їх AI-інструментам рівень ефективності буде дуже низьким. А це призводить до купи додаткового часу на коригування промптів чи доведення до ладу згенерованого коду. І, зрозуміло, експерту швидше просто взяти й зробити руками.
Щоб у такому дослідженні отримувати серйозний приріст ефективності від використання AI-інструментів, треба спочатку інвестувати у формалізацію та документацію знань. Сюди входять загальна структура репозиторію, правила технічного дизайну, стандарти розробки, особливості й неявні правила, історичний техборг тощо. Це дуже нагадує онбординг нового розробника в проєкт.
Тому практично всі інструменти підтримують зчитування подібних знань зі спеціальних файлів у контекст вирішення задачі на рівні всього репозиторію або конкретної директорії. І ось тоді вже навіть автономне вирішення задач агентом приносить набагато приємніші результати.
Але експеримент однаково дуже цікавий, і раджу прочитати його в повній версії, а не у форматі короткої статті з висновками.