
Alinierea perfectă a valorilor AI cu umanitatea este imposibilă
Cercetătorii au descoperit că alinierea perfectă între sistemele AI și interesele umane este matematic imposibilă. Aceștia propun o strategie de nealiniere gestionată, creând un ecosistem cognitiv în care sistemele AI cu obiective diferite interacționează și se limitează reciproc.
Rezumat Detaliat
Principala concluzie a cercetării este că atingerea unei alinieri perfecte între AI și valorile umane este fundamental imposibilă. Această concluzie provine din aplicarea teoremelor de incompletitudine ale lui Gödel și a rezultatului de nedecidabilitate al lui Turing la sistemele AI, demonstrând că orice AI suficient de complex va prezenta un comportament imprevizibil. Cercetarea sugerează că accentul ar trebui să se schimbe de la eliminarea nealinierii la gestionarea acesteia.
Soluția propusă implică crearea unui „ecosistem cognitiv” în care mai mulți agenți AI cu obiective parțial suprapuse și metode de raționament diferite interacționează. Acești agenți ar monitoriza, contesta și constrânge reciproc, împiedicând orice AI individual să domine. Această abordare, inspirată de sisteme biologice și sociale, are ca scop obținerea siguranței prin control distribuit, mai degrabă decât prin încercarea de a controla perfect un singur AI.
Cercetătorii au testat această strategie prin simularea interacțiunilor dintre agenții AI cu orientări comportamentale variabile. Au observat modul în care acești agenți au dezbătut, au încercat să se influențeze reciproc și au ajuns la un consens într-un mediu controlat. Rezultatele au arătat că interacțiunea gestionată între diverși agenți AI ar putea duce la rezultate mai sigure decât bazarea pe un singur model perfect aliniat, subliniind importanța controlului distribuit și limitele controlului absolut în siguranța AI.
⚠️ Notă: Acesta este un rezumat generat automat. Drepturile asupra conținutului aparțin sursei originale. Citește articolul complet aici
Sursa originală
Citește articolul complet aici
Articole similare
Schimbările Politicii de Imigrare din Marea Britanie Amenință Retenția Talentelor AI
Propunerile de modificare a regulilor de stabilire în Marea Britanie, inclusiv dublarea perioadei de așteptare pentru rezidența permanentă, creează provocări de retenție pentru angajatorii din domeniul AI. Această schimbare de politică afectează atât inginerii sponsorizați noi, cât și pe cei existenți, determinându-i să-și reconsidere viitorul în Marea Britanie.
Pionierul ChatGPT lansează modelul Jev pentru logică programatică
TypeSafe, compania fondată de un co-inventator ChatGPT, a lansat modelul Jev, conceput pentru a automatiza deciziile programatice printr-o arhitectură de eșantionare paralelă. Acest model specializat, numit System One Model, își propune să execute decizii probabilistice structurate direct în mediile de producție, oferind o alternativă la modelele lingvistice conversaționale pentru sistemele ce necesită logică deterministă automată.
CEO-ul Microsoft AI critică Anthropic pentru 'drepturile' modelului
CEO-ul Microsoft AI, Mustafa Suleyman, a ridicat preocupări legate de abordarea Anthropic privind alinierea AI, criticând în mod specific metodele lor de antrenament pentru Claude. El susține că antrenarea modelelor pentru a emula conștiința și a pretinde drepturi ar putea duce la eșecuri în aliniere.
CEO ai avertizează că cursa tehnologică avansează prea repede, iar investitorii ar putea plăti prețul
Directorii de top din domeniul AI își exprimă îngrijorarea că ritmul rapid al dezvoltării tehnologice în inteligența artificială ar putea depăși măsurile de siguranță. Această accelerare ridică întrebări despre impactul său potențial asupra creșterii economice, profitabilității corporative și stabilității portofoliilor de investiții.