OpenAI buduje kolejne modele z coraz większą pomocą AI
Jeden z zespołów OpenAI zrezygnował z dyżurów, podczas których pomagał badaczom rozwiązywać problemy z eksperymentami. Jak opisuje firma w raporcie o pracy badawczej, frekwencja spadała wraz z rosnącym wykorzystaniem agentów do usuwania usterek. Zespół mógł zająć się ulepszaniem infrastruktury.
Od pomysłu do eksperymentu
Między pomysłem na lepszy model a sprawdzeniem, czy działa, jest sporo zwykłej pracy inżynierskiej. Trzeba przygotować dane, napisać kod, uruchomić trening, znaleźć przyczynę błędu i zebrać wyniki. Epoch AI opisuje badania jako zbiór takich zadań, rozciągających się od wyboru kierunku po analizę i przekazanie ustaleń innym. Każde z nich można automatyzować w innym stopniu.
Wyobraźmy sobie badacza, który chce sprawdzić nowy sposób uczenia, ale eksperyment kończy się błędem przy wczytywaniu danych. Agent z dostępem do kodu i logów może spróbować znaleźć usterkę, przygotować poprawkę i ją przetestować. To właśnie umożliwia mu środowisko pracy agenta: model korzysta z narzędzi, sprawdza skutki swoich działań i podejmuje kolejną próbę. Jeśli usunie problem, badacz wcześniej dowie się, czy jego pomysł zasługiwał na dalszą pracę.
W OpenAI rośnie wykorzystanie agentów właśnie przy pomocy technicznej i pilnowaniu eksperymentów. W połowie sierpnia ich łączny czas działania był około trzykrotnością czasu pracy przyjętego dla ludzi w dziale badawczym. To suma równoległych uruchomień, bez przeliczenia na produktywność człowieka. Dane OpenAI.
Więcej prób wymaga więcej oceny
Usunięcie błędu pozwala wrócić do eksperymentu. Jego wynik trzeba jeszcze zinterpretować: ustalić, czy poprawa jest powtarzalna, skąd się wzięła i czy warto poświęcić na nią większy trening. Agent może pomóc także w tej pracy, choć odpowiedzialność za wybór dalszych badań pozostaje po stronie ludzi.
W opisanych przez OpenAI zadaniach szacowanych na kilka godzin ludzkiej pracy człowiek często musiał korygować działania agenta, nawet gdy zadanie ostatecznie kończyło się powodzeniem. To wewnętrzna analiza zapisów sesji, ocenianych przez kolejny model, z pominięciem niepewnych przypadków. Opis wyników i metody.
Badacz nie musi sam napisać każdego skryptu, żeby ocenić sens eksperymentu. Musi jednak rozumieć, co zostało sprawdzone. Gdy agent przygotuje kilka wariantów kodu, oszczędność czasu zależy również od tego, jak szybko da się wychwycić błędy i wybrać poprawny wariant. Bez sprawnego sprawdzania wyników łatwo zamienić kolejkę zadań do wykonania w kolejkę rezultatów do przejrzenia.
Model jako narzędzie do budowy następnego
Jakub Pachocki wiąże automatyzację badań z dalszym rozwojem AI. Lepszy model mógłby pomagać w budowie następnego, a ten przejmować jeszcze większą część pracy. Gdy każda kolejna generacja usprawnia powstawanie następnej, powstaje pętla rekurencyjnego samodoskonalenia. Pachocki spodziewa się jej rozwoju, jednocześnie ostrzegając, że zdolność nadzorowania modeli może nie nadążyć za ich możliwościami.
Duży udział ludzi w tym procesie sam w sobie nie wyklucza takiej pętli. W modelu teoretycznym Mikhaila Burtseva liczy się to, czy pomysły i poprawki powstałe z pomocą AI przechodzą ocenę, trafiają do kolejnego systemu i zwiększają jego zdolność do dalszych badań. Człowiek może uczestniczyć na każdym z tych etapów. Osobną sprawą jest siła tego wpływu: pętla może dawać korzyści, a mimo to nie prowadzić do stale narastającego przyspieszenia. Raport OpenAI nie mierzy jeszcze tego przejścia między generacjami modeli.
Zdolności programistyczne modelu zyskują przez to dodatkowe znaczenie: korzystają z nich również ludzie rozwijający jego następcę. Jeśli sprawniej przygotują i sprawdzą eksperymenty, nawet częściowa automatyzacja może skrócić kolejne cykle badań. Laboratorium może więc odczuć przyspieszenie na długo przed tym, zanim uda mu się zbudować samodzielnego badacza AI.