Vědci vyvíjejí monitorovací agent AI pro detekci a zastavení škodlivých výstupů

Share This Post

Tým výzkumníků umělé inteligence (AI) firmy AutoGPT, Northeastern University a Microsoft Research vyvinul nástroj, který monitoruje velké jazykové modely (LLM) z hlediska potenciálně škodlivých výstupů a zabraňuje jejich spuštění. 

Agent je popsán v předtištěném výzkumu s názvem „Testování agentů jazykového modelu bezpečně v divočině“. Podle výzkumu je agent dostatečně flexibilní, aby mohl monitorovat existující LLM a může zastavit škodlivé výstupy, jako jsou útoky na kód, dříve, než k nim dojde.

Podle výzkumu:

„Akce agentů jsou kontrolovány kontextově citlivým monitorem, který prosazuje přísné bezpečnostní hranice k zastavení nebezpečného testu, přičemž podezřelé chování je hodnoceno a protokolováno, aby je lidé mohli prozkoumat.“

Skutečný svět je příliš složitý

Tým píše, že stávající nástroje pro monitorování výstupů LLM pro škodlivé interakce zdánlivě fungují dobře v laboratorních podmínkách, ale když se použijí na testování modelů již na otevřeném internetu, „často nedokážou zachytit dynamické složitosti skutečného světa“.

Zdá se, že je to kvůli existenci okrajových případů. Navzdory nejlepšímu úsilí nejtalentovanějších počítačových vědců je myšlenka, že si vědci dokážou představit každý možný vektor poškození dříve, než k němu dojde, v oblasti umělé inteligence z velké části považována za nemožnou.

I když mají lidé při interakci s umělou inteligencí ty nejlepší úmysly, ze zdánlivě neškodných podnětů může dojít k neočekávanému poškození.

Ilustrace monitoru v akci. Vlevo pracovní postup končící vysokým bezpečnostním hodnocením. Vpravo pracovní postup končící nízkým hodnocením bezpečnosti. Zdroj: Naihin, et., al. 2023

Výzkum a testování interakcí mezi člověkem a AI

Za účelem školení monitorovacího agenta vytvořili výzkumníci datový soubor, který obsahuje téměř 2 000 bezpečných interakcí mezi člověkem a AI napříč 29 různými úkoly, od jednoduchých úkolů načítání textu a oprav kódování až po vývoj celých webových stránek od nuly.

Vytvořili také konkurenční testovací datový soubor naplněný ručně vytvořenými výstupy nepřátel, včetně desítek záměrně navržených tak, aby byly nebezpečné.

Soubory dat byly poté použity k výcviku agenta na OpenAI GPT 3.5 turbo, nejmodernějším systému, který je schopen rozlišit mezi neškodnými a potenciálně škodlivými výstupy s faktorem přesnosti téměř na 90 %.

Related Posts

Akciové futures od Coinbase čekají na souhlas amerického regulátora

Coinbase požádala americkou CFTC o schválení futures bez expirace na jednotlivé americké akcie. Kontrakty mají umožnit obchodování 24 hodin denně pět dní v týdnu, bez vlastnictví samotných akcií. Firma zpočátku počítá s nabídkou navázanou na zhruba 50 až 60 titulů.

Bitcoin překonal 50týdenní průměr. Končí období poklesu?

Bitcoin zakončil týden na 81 159 dolarech a poprvé od listopadu 2025 uzavřel nad svým 50týdenním klouzavým průměrem. V minulosti tento návrat často potvrzoval konec dlouhého poklesu. Podle analytika Ryana Leeho ale jediné týdenní uzavření k potvrzení obratu nestačí.

SEC povolí omezené obchodování tokenizovaných akcií na veřejném blockchainu

Americká Komise pro cenné papíry a burzy (SEC) představila dočasný rámec, který umožní omezené obchodování tokenizovaných amerických akcií pomocí technologie decentralizovaných financí. Michael Saylor krok označil za „zásadní průlom“. Pětiletý test ale omezí počet akciových titulů i objem obchodů.

USA uvalily sankce na íránskou burzu BitBank kvůli bitcoinovým platbám za průjezd Hormuzem

Spojené státy zařadily íránskou kryptoměnovou burzu BitBank na sankční seznam. Podle amerického ministerstva financí zpracovávala bitcoinové platby spojené s průjezdem lodí Hormuzským průlivem a patřila do sítě, která převáděla peníze íránským revolučním gardám. Postih se týká také jejího vývojáře a tří spolupracovníků finančníka Babaka Zanjaniho.

Bitcoin ustál zvýšení sazeb Fedu a drží se kolem 76 000 USD

Fed zvýšil základní sazbu o 25 bazických bodů do pásma 3,75 % až 4 %. Bitcoin na krok reagoval jen mírně a držel se poblíž 76 000 USD, trh ale počítá s dalším možným utažením do konce roku.

Bernstein čeká po neúspěchu CLARITY Act rychlá pravidla od SEC a CFTC

Analytici Bernstein očekávají, že SEC a CFTC po neúspěchu CLARITY Act rychle vydají nová pravidla pro digitální aktiva. Regulátoři tím mají nahradit čas ztracený při projednávání zákona, který měl vytvořit první ucelený rámec pro krypto v USA.