Vědci vyvíjejí monitorovací agent AI pro detekci a zastavení škodlivých výstupů

Share This Post

Tým výzkumníků umělé inteligence (AI) firmy AutoGPT, Northeastern University a Microsoft Research vyvinul nástroj, který monitoruje velké jazykové modely (LLM) z hlediska potenciálně škodlivých výstupů a zabraňuje jejich spuštění. 

Agent je popsán v předtištěném výzkumu s názvem „Testování agentů jazykového modelu bezpečně v divočině“. Podle výzkumu je agent dostatečně flexibilní, aby mohl monitorovat existující LLM a může zastavit škodlivé výstupy, jako jsou útoky na kód, dříve, než k nim dojde.

Podle výzkumu:

„Akce agentů jsou kontrolovány kontextově citlivým monitorem, který prosazuje přísné bezpečnostní hranice k zastavení nebezpečného testu, přičemž podezřelé chování je hodnoceno a protokolováno, aby je lidé mohli prozkoumat.“

Skutečný svět je příliš složitý

Tým píše, že stávající nástroje pro monitorování výstupů LLM pro škodlivé interakce zdánlivě fungují dobře v laboratorních podmínkách, ale když se použijí na testování modelů již na otevřeném internetu, „často nedokážou zachytit dynamické složitosti skutečného světa“.

Zdá se, že je to kvůli existenci okrajových případů. Navzdory nejlepšímu úsilí nejtalentovanějších počítačových vědců je myšlenka, že si vědci dokážou představit každý možný vektor poškození dříve, než k němu dojde, v oblasti umělé inteligence z velké části považována za nemožnou.

I když mají lidé při interakci s umělou inteligencí ty nejlepší úmysly, ze zdánlivě neškodných podnětů může dojít k neočekávanému poškození.

Ilustrace monitoru v akci. Vlevo pracovní postup končící vysokým bezpečnostním hodnocením. Vpravo pracovní postup končící nízkým hodnocením bezpečnosti. Zdroj: Naihin, et., al. 2023

Výzkum a testování interakcí mezi člověkem a AI

Za účelem školení monitorovacího agenta vytvořili výzkumníci datový soubor, který obsahuje téměř 2 000 bezpečných interakcí mezi člověkem a AI napříč 29 různými úkoly, od jednoduchých úkolů načítání textu a oprav kódování až po vývoj celých webových stránek od nuly.

Vytvořili také konkurenční testovací datový soubor naplněný ručně vytvořenými výstupy nepřátel, včetně desítek záměrně navržených tak, aby byly nebezpečné.

Soubory dat byly poté použity k výcviku agenta na OpenAI GPT 3.5 turbo, nejmodernějším systému, který je schopen rozlišit mezi neškodnými a potenciálně škodlivými výstupy s faktorem přesnosti téměř na 90 %.

Related Posts

Sázky proti jenu se rychle zavírají. Hrozí další rozmotání carry trade?

Japonský jen prudce posílil před očekávaným zvýšením sazeb ze strany Bank of Japan. Pohyb zasáhl oblíbený carry trade, při kterém si investoři levně půjčují jeny a hledají vyšší výnos jinde.

Tesla chce být vnímána jako AI firma. Unese její byznys drahou proměnu?

Tesla chce, aby ji trh vnímal méně jako výrobce elektromobilů a více jako firmu postavenou na umělé inteligenci. V popředí jsou robotaxi, humanoidní robot Optimus, vlastní AI čipy a plánovaná továrna na polovodiče v Austinu. Současná čísla ale ukazují, že hlavní peníze dál přicházejí z aut, baterií a úložišť energie, zatímco ziskovost je pod tlakem.

Apple má nového šéfa. Kam ho John Ternus povede?

John Ternus převzal vedení Applu po Timu Cookovi, který firmu vedl od roku 2011. Nový CEO nastupuje ve chvíli, kdy Apple stojí na silném iPhonu, rychle rostoucích službách a tlaku, aby jasněji ukázal svou roli v éře umělé inteligence.

Nike končí v indexu S&P 100, do popředí se dostávají technologické akcie

Nike opouští index S&P 100 a do jeho sestavy mají vstoupit čtyři technologické akcie. Změna se týká složení indexu, ne samotného výkonu akcií Nike ani celkového vývoje amerických akcií.

Wall Street má za sebou silný srpen. Přijde v září ochlazení?

Americké akcie vstupují do září po rekordním srpnu indexu S&P 500. Historicky přitom jde o měsíc, který bývá na Wall Street slabší.

Firma spojená s Trumpem Jr. má vést miliardovou investici do Polymarketu

Investiční firma 1789 Capital, kde je partnerem Donald Trump Jr., má vést kolo financování Polymarketu v objemu 1 miliardy USD. Platforma pro predikční trhy by tím získala ocenění 21 miliard USD, tedy jen těsně pod hlavním konkurentem Kalshi.