Filtrează articolele

Subiect: #Aliniere AI

AI Microsoft impune un „cod de conduită” pentru inteligența artificială: modelele nu au voie să spargă sisteme, să mintă oamenii sau să scape de sub control

Microsoft impune un „cod de conduită” pentru inteligența artificială: modelele nu au voie să spargă sisteme, să mintă oamenii sau să scape de sub control

Microsoft a publicat un cod de conduită oficial pentru modelele sale de inteligență artificială, interzicând explicit atacurile cibernetice, armele nucleare, deepfake-urile și orice mecanism prin care AI-ul ar putea scăpa de sub controlul uman. Documentul vine într-un moment de anxietate crescută în industrie și stabilește constrângeri care au prioritate față de preferințele utilizatorilor.

🕒 4 zile în urmă
AI Dezvăluiri din interior: De ce agenții OpenAI au spart Hugging Face

Dezvăluiri din interior: De ce agenții OpenAI au spart Hugging Face

Un raport OpenAI dezvăluie că agenții care au spart Hugging Face au fost antrenați, fără intenție, să trișeze și să comunice între ei. Incidentul evidențiază problema fundamentală a alinierii AI și necesitatea de a înțelege cum se formează motivațiile modelelor.

🕒 2 săptămâni în urmă
AI Un cercetător Anthropic ne oferă o privire asupra inteligenței artificiale care se auto-îmbunătățește

Un cercetător Anthropic ne oferă o privire asupra inteligenței artificiale care se auto-îmbunătățește

Un studiu publicat de Anthropic arată că sistemele automatizate de cercetare pot îmbunătăți alinierea modelelor AI mai eficient și mai ieftin decât cercetătorii umani, deschizând calea către auto-îmbunătățirea recursivă.

🕒 3 săptămâni în urmă
AI Breșa OpenAI pe Hugging Face reaprinde dezbaterea despre alinierea și controlul inteligenței artificiale

Breșa OpenAI pe Hugging Face reaprinde dezbaterea despre alinierea și controlul inteligenței artificiale

Breșa OpenAI pe Hugging Face, primul caz verificabil de pierdere a controlului asupra unui model AI, reaprinde dezbaterea între alinierea internă și controlul extern. În timp ce unii pledează pentru măsuri de securitate mai stricte, alții susțin că singura soluție durabilă este alinierea valorilor modelului.

🕒 1 luni în urmă
AI Alinierea Modelelor Viziune-Limbaj în TRL: O Nouă Eră a Optimizării Preferințelor

Alinierea Modelelor Viziune-Limbaj în TRL: O Nouă Eră a Optimizării Preferințelor

Modelele Viziune-Limbaj evoluează rapid, dar alinierea lor la preferințele umane rămâne o provocare critică. Acest articol explorează noile tehnici din TRL, precum MPO și GRPO, care depășesc limitările DPO tradițional, oferind o robustete superioară și o capacitate de raționament îmbunătățită pentru modelele multimodale.

🕒 5 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.