Filtrează articolele

Subiect: #post-antrenament

AI AllenAI Open Instruct Tulu 3: Post-Antrenament cu SFT, DPO, RLVR, GRPO și Evaluare pe Bază de Verificator

AllenAI Open Instruct Tulu 3: Post-Antrenament cu SFT, DPO, RLVR, GRPO și Evaluare pe Bază de Verificator

AllenAI a lansat Open Instruct Tulu 3, un model open-source care integrează tehnici avansate de post-antrenament: SFT, DPO, RLVR, GRPO și evaluare pe bază de verificator. Acest articol explică fiecare metodă și impactul lor asupra performanței modelului.

🕒 1 luni în urmă

Z.ai lansează GLM-5.3 fără reantrenarea modelului de bază: performanțe superioare în codare complexă și sarcini pe termen lung

Z.ai lansează GLM-5.3, o versiune care reutilizează baza de 743B a GLM-5.2 fără reantrenare, obținând îmbunătățiri spectaculoase prin post-antrenament scalat. Performanțe remarcabile în codare, sarcini pe termen lung și securitate cibernetică, cu greutăți disponibile în curând.

🕒 1 luni în urmă

Ghid de codare pentru post-antrenamentul LLM cu TRL: de la Supervised Fine Tuning la DPO și GRPO Reasoning

Un ghid practic de codare pentru post-antrenamentul modelelor de limbaj mari (LLM) folosind biblioteca TRL, acoperind Supervised Fine Tuning (SFT), Direct Preference Optimization (DPO) și Group Relative Policy Optimization (GRPO), cu exemple de cod și explicații detaliate.

🕒 4 luni în urmă

Acest site folosește cookie-uri pentru a-ți oferi o experiență de navigare cât mai plăcută. Continuarea navigării implică acceptarea acestora.