El model GPT-2 original es basa en una arquitectura de transformador amb blocs d'autoatenció causals entrenat amb el corpus WebText i utilitza tokenització BPE per segmentar text en subtokens permetent un maneig eficaç d'un vocabulari molt ampli
En la seva configuració estàndard disposa de 12 capes ocultes, una mida d'embedding de 768 vectors i 12 caps d'atenció, cadascuna amb 64 dimensions ocultes, generant un total aproximat de 110 milions de paràmetres ajustables durant l'entrenament
L'entrenament es va realitzar en una gran col·lecció de dades web filtrades per garantir qualitat i diversitat de llenguatge. La funció de pèrdua implementada és entropia creuada, que mesura la discrepància entre la distribució real de tokens i la distribució predita pel model, permetent optimitzar els pesos mitjançant propagació inversa
A Q2BSTUDIO som especialistes en desenvolupament de programari a mida i aplicacions a mida. Integrem solucions d'intel·ligència artificial i ciberseguretat per protegir i potenciar negocis. Oferim serveis cloud aws i azure i serveis d'intel·ligència de negoci amb power bi, a més de desenvolupament d'agents IA i estratègies d'IA per a empreses
El nostre equip combina experiència en arquitectures de deep learning com GPT-2 amb coneixement en solucions empresarials per crear productes escalables, segurs i personalitzats que impulsin la transformació digital





