Vědci vyvíjejí monitorovací agent AI pro detekci a zastavení škodlivých výstupů

Share This Post

Tým výzkumníků umělé inteligence (AI) firmy AutoGPT, Northeastern University a Microsoft Research vyvinul nástroj, který monitoruje velké jazykové modely (LLM) z hlediska potenciálně škodlivých výstupů a zabraňuje jejich spuštění. 

Agent je popsán v předtištěném výzkumu s názvem „Testování agentů jazykového modelu bezpečně v divočině“. Podle výzkumu je agent dostatečně flexibilní, aby mohl monitorovat existující LLM a může zastavit škodlivé výstupy, jako jsou útoky na kód, dříve, než k nim dojde.

Podle výzkumu:

„Akce agentů jsou kontrolovány kontextově citlivým monitorem, který prosazuje přísné bezpečnostní hranice k zastavení nebezpečného testu, přičemž podezřelé chování je hodnoceno a protokolováno, aby je lidé mohli prozkoumat.“

Skutečný svět je příliš složitý

Tým píše, že stávající nástroje pro monitorování výstupů LLM pro škodlivé interakce zdánlivě fungují dobře v laboratorních podmínkách, ale když se použijí na testování modelů již na otevřeném internetu, „často nedokážou zachytit dynamické složitosti skutečného světa“.

Zdá se, že je to kvůli existenci okrajových případů. Navzdory nejlepšímu úsilí nejtalentovanějších počítačových vědců je myšlenka, že si vědci dokážou představit každý možný vektor poškození dříve, než k němu dojde, v oblasti umělé inteligence z velké části považována za nemožnou.

I když mají lidé při interakci s umělou inteligencí ty nejlepší úmysly, ze zdánlivě neškodných podnětů může dojít k neočekávanému poškození.

Ilustrace monitoru v akci. Vlevo pracovní postup končící vysokým bezpečnostním hodnocením. Vpravo pracovní postup končící nízkým hodnocením bezpečnosti. Zdroj: Naihin, et., al. 2023

Výzkum a testování interakcí mezi člověkem a AI

Za účelem školení monitorovacího agenta vytvořili výzkumníci datový soubor, který obsahuje téměř 2 000 bezpečných interakcí mezi člověkem a AI napříč 29 různými úkoly, od jednoduchých úkolů načítání textu a oprav kódování až po vývoj celých webových stránek od nuly.

Vytvořili také konkurenční testovací datový soubor naplněný ručně vytvořenými výstupy nepřátel, včetně desítek záměrně navržených tak, aby byly nebezpečné.

Soubory dat byly poté použity k výcviku agenta na OpenAI GPT 3.5 turbo, nejmodernějším systému, který je schopen rozlišit mezi neškodnými a potenciálně škodlivými výstupy s faktorem přesnosti téměř na 90 %.

Related Posts

BTCPay omezuje vzdálený přístup k Lightning uzlům po krádeži prostředků

BTCPay Server dočasně omezil veřejný vzdálený přístup k Lightning uzlům používajícím LND. Reaguje tak na zranitelnost, přes kterou mohl neověřený útočník získat přihlašovací soubory a přesunout prostředky. Projekt vydal verzi 2.4.2 a doporučuje správcům kontrolu plateb, kanálů i zůstatků.

Akcie Palantiru vyskočily po silném čtvrtletí o 15 procent

Akcie Palantiru v úterý 4. srpna v pre-market obchodování vzrostly o 15 procent. Firma ve druhém čtvrtletí výrazně překonala očekávání Wall Street, zvedla výhled tržeb a ukázala silný růst u komerčních zákazníků i v americkém vládním segmentu.

Tether vydělal ve čtvrtletí 1,5 miliardy USD, rezervní polštář ale klesl na polovinu

Tether vykázal za druhé čtvrtletí roku 2026 čistý provozní zisk 1,5 miliardy dolarů. Firma zároveň držela aktiva za 187,75 miliardy dolarů proti závazkům 183,64 miliardy dolarů, takže její přebytečné rezervy klesly na 4,11 miliardy dolarů.

Wall Street zažila nejhorší den od dubna 2025. Ztrácí Fed důvěru trhu?

Wall Street po rozhodnutí Fedu ponechat sazby beze změny prudce oslabila a zažila nejhorší den od dubna 2025. Trh tím dal najevo rostoucí nervozitu.

Strategy zvýšila hotovost na 3,75 miliardy USD a odkoupila STRC

Strategy zvýšila hotovostní rezervu na 3,75 miliardy USD poté, co prodejem kmenových akcií získala 544,5 milionu USD. Část peněz použila na zpětný odkup preferenčních akcií STRC, zatímco její bitcoinová pozice zůstala beze změny.

Bílý dům viní Moonshot AI ze zneužití technologie Anthropic pro Kimi K3

Bílý dům obvinil Moonshot AI, že při vývoji modelu Kimi K3 využila distilaci technologie Anthropic. Část expertů ale zpochybňuje, že by výkon nového čínského modelu šlo vysvětlit právě tímto postupem.