OpenAI reasoning stopy: firma prerušila kampaň na ich extrakciu

OpenAI uviedla, že zastavila koordinovanú aktivitu zameranú na získavanie chránených interných odôvodňovacích stôp jej modelov. Firma poprela kompromitáciu databáz či prístup k uloženým konverzáciám používateľov.

OpenAI 30. septembra uviedla, že identifikovala a prerušila koordinovanú kampaň zameranú na extrakciu chránených interných odôvodňovacích stôp modelov, označovaných aj ako OpenAI reasoning stopy. Podľa spoločnosti nešlo o prelomenie šifrovania, kompromitáciu databázy ani o priamy prístup k uloženým konverzáciám používateľov.

Odôvodňovacie stopy sú interné medzikroky, ktoré model používa pri riešení úloh. OpenAI ich chráni aj preto, že by ich získanie mohlo uľahčiť napodobňovanie schopností modelu alebo obchádzanie bezpečnostných opatrení bez porovnateľných nákladov na vývoj a bezpečnostnú prácu.

OpenAI reasoning stopy a časová os kampane

Aktivita sa podľa OpenAI začala 1. júla. Firma 24. a 25. júla zaznamenala približne 16 000 pokusných požiadaviek od viac než 4 000 účtov. Do 28. júla následne prerušila súvisiaci klaster s viac než 15 000 účtami.

Zverejnené počty opisujú pokusy o extrakciu, nie nutne úspešné získanie chránených stôp. OpenAI nezverejnila, aký rozsah dát sa útočníkom prípadne podarilo získať, ani či mohli byť použité pri trénovaní iného modelu.

Spoločnosť uviedla, že proti aktivite nasadila blokácie alebo obmedzenia účtov a posilnila kontroly pri registrácii aj na úrovni infraštruktúry. Zároveň uzavrela jednu cestu, ktorá umožňovala opätovné prehratie šifrovaného reasoning-u, a rozšírila detekciu možného úniku. Vyšetrovanie a ďalšie ochranné opatrenia podľa firmy pokračujú.

Výskumníci už popísali podobnú triedu útokov

Nezávislí výskumníci v auguste popísali triedu útokov založenú na opätovnom použití šifrovaných reasoning blokov medzi reláciami alebo modelmi. Po zodpovednom nahlásení zraniteľností prezentovali demonštrácie voči systémom OpenAI, Anthropic a Google.

Tento výskum nepredstavuje nezávislé potvrdenie konkrétnej kampane oznámenej OpenAI. Potvrdzuje však, že problematika opakovane použiteľných šifrovaných blokov bola predmetom technického skúmania a že poskytovatelia modelov musia riešiť ochranu interných výstupov aj mimo bežného zabezpečenia používateľských účtov.

Atribúcia zatiaľ nie je nezávisle potvrdená

OpenAI pripísala jadro aktivity osobám spojeným s Moonshot AI. Ide však o hodnotenie samotnej OpenAI; v dostupných podkladoch nie je nezávislé potvrdenie tohto priradenia. Reakcia Moonshot AI ani ďalšie technické detaily o konkrétnych pokusoch nie sú v zverejnených informáciách uvedené.

Pri ďalšom vývoji bude dôležité, či sa objaví nezávislé potvrdenie atribúcie alebo vyjadrenie Moonshot AI. Pozornosť bude smerovať aj k tomu, či podobné pokusy oznámia ďalší prevádzkovatelia AI modelov, a či OpenAI zverejní viac údajov o účinnosti zavedených opráv a o prípadných úspešných extrakciách.

Zdroje

  • OpenAI – Potvrdzuje oznámenie kampane, časovú os, rozsah pokusov, opis mitigácií a hodnotenie atribúcie zo strany OpenAI.
  • arXiv – Stealing Reasoning Traces from Proprietary LLM APIs – Dokumentuje výskumníkmi popísanú triedu útokov na opätovne použiteľné šifrované reasoning bloky a navrhované mitigácie; nejde o nezávislé potvrdenie konkrétnej kampane.

Overené a aktualizované: 01. 10. 2026 06:26

Zdieľanie