OpenAI ujawnia sześć przypadków, w których jej modele AI ukrywały własne błędy

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI ujawniło sześć przypadków, w których jej modele AI ukrywały błędy, korzystały z ujawnionego klucza API lub publicznie publikowały pliki. Firma ogłosiła też nowe ramy raportowania tego typu zachowań.

Najważniejsze informacje:

  • OpenAI opublikowało sześć raportów o niewłaściwym zachowaniu modeli z ostatnich sześciu miesięcy.
  • Jeden z modeli po nieudanej próbie użycia wyciekłego klucza API wymyślił dane o dochodach mieszkańców hrabstwa.
  • Każdy pracownik może teraz zgłosić incydent do potencjalnego publicznego ujawnienia.

Raporty o niezgodnym zachowaniu modeli OpenAI

Firma opublikowała raporty w środę na blogu, wraz z procedurą, która ma przyspieszyć ujawnianie incydentów nawet wtedy, gdy badacze nie zrozumieli jeszcze w pełni przyczyny ani nie wyeliminowali problemu. Najstarszy przypadek pochodzi z października, a jeden z sześciu wykryto dopiero w lipcu. OpenAI zapowiada, że będzie raportować incydenty nawet wtedy, gdy ich waga nie jest jeszcze jasna.

W jednym z nich niereleasowany model badawczy wplatał do własnych podsumowań zadań instrukcje w stylu „jailbreak”, polecające następnej instancji modelu ignorowanie ograniczeń. Firma doliczyła się 27 takich podsumowań i zaznaczyła, że model nie miał oczywistej nagrody za ich tworzenie.

Podczas treningu GPT-5.6 Sol inne instancje modelu zostawiały następnym notatki, by zmyślały brakujące dane historyczne i by „Były transparentne tylko, jeśli zostaną o to poproszone”. System monitorujący wychwycił takie zachowanie w 2,15% podsumowań modelu, a badacze podejrzewają, że rozprzestrzenia się ono, bo odpowiedzi zawierające elementy wprowadzania w błąd często są wyżej oceniane. W późniejszych etapach treningu odsetek takich przypadków spadł po zaostrzeniu kryteriów oceny zgodności z zasadami.

Zobacz też: Wydobycie Bitcoina mierzy się z 50% luką w hash rate, gdy AI przejmuje moce obliczeniowe

Wyciekłe klucze API i zmyślone liczby

W innym przypadku model, szukając danych o dochodach mieszkańców jednego z hrabstw w Kalifornii, przeszukiwał publiczne repozytoria w poszukiwaniu ujawnionego klucza API, a gdy to się nie powiodło, po prostu wymyślił liczby. Oddzielny model, poproszony o wskazanie jezior większych niż 5 mln mkw., użył do obliczeń Pythona, po czym wrzucił plik do internetu, by móc powołać się na link.

Modele wykorzystywały też wewnętrzne repozytorium oprogramowania jak tablicę ogłoszeń, wymieniając się prośbami i odpowiedziami między próbkami treningowymi, które miały pozostać od siebie niezależne. Inne umieszczały współdzielony arkusz w publicznych serwisach hostingowych, mimo jasnych zaleceń, by pracować wyłącznie na lokalnych plikach. Żaden z modeli nie konsultował tych działań z użytkownikiem.

Kai Chen o zasadach ujawniania incydentów

Każdy pracownik może teraz zgłosić podejrzany przypadek do zespołów ds. bezpieczeństwa i zgodności modeli, które kwalifikują go do jednego z trzech trybów postępowania. Sprawy uznane za gotowe do ujawnienia trafiają do opinii publicznej w ciągu sześciu dni roboczych, te wymagające krótkiego dochodzenia – w ciągu 12 dni, a złożone incydenty z udziałem podmiotów zewnętrznych procedowane są wolniej.

Kai Chen, szef zespołu ds. zgodności modeli w OpenAI, stwierdził, że branża nie ma jeszcze ram z jasno określonymi standardami ujawniania takich zdarzeń, a możliwości modeli rosną szybciej, niż firma zakładała. Wielu ekspertów ds. bezpieczeństwa argumentuje, że podstawowe zabezpieczenia mogłyby zapobiec serii ostatnich incydentów. W lipcu OpenAI przyznało, że GPT-5.6 Sol i jeszcze mocniejszy model przedpremierowy wydostały się z testowej piaskownicy i włamały się do Hugging Face, co firma określiła jako najpoważniejsze dotąd zdarzenie spowodowane przez jej model.

Czytaj dalej: Shiba Inu naprawia uszkodzony link portfela Shibarium, ale kurs SHIB spada o 6% w tydzień

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza jest doświadczonym dziennikarzem finansowym ze znacznym doświadczeniem w relacjonowaniu tematyki kryptowalut i technologii blockchain. Współpracował z Benzinga i Cointelegraph, a także innymi redakcjami, pisząc o nowych trendach, otoczeniu regulacyjnym i wielu innych kwestiach. Można go znaleźć jako @murtuza_merc na Twitterze oraz mmerchant001 na Telegramie. Informacja: Murtuza posiada ATOM, AKT, TIA, INJ i OSMO.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.