Skip to content

Latest commit

 

History

History
93 lines (56 loc) · 8.12 KB

File metadata and controls

93 lines (56 loc) · 8.12 KB

Atviro kodo modeliai

Įvadas

Atviro kodo LLM pasaulis yra įdomus ir nuolat besivystantis. Ši pamoka siekia išsamiai apžvelgti atviro kodo modelius. Jei ieškote informacijos apie tai, kaip nuosavybiniai modeliai lyginami su atviro kodo modeliais, apsilankykite pamokoje "Skirtingų LLM tyrinėjimas ir palyginimas". Šioje pamokoje taip pat bus aptarta modelių pritaikymo tema, tačiau išsamesnį paaiškinimą rasite pamokoje "LLM pritaikymas".

Mokymosi tikslai

  • Suprasti atviro kodo modelius
  • Suprasti atviro kodo modelių privalumus
  • Tyrinėti atvirus modelius, prieinamus Hugging Face ir Azure AI Studio platformose

Kas yra atviro kodo modeliai?

Atviro kodo programinė įranga atliko svarbų vaidmenį technologijų plėtroje įvairiose srityse. Atviro kodo iniciatyva (OSI) apibrėžė 10 kriterijų programinei įrangai, kad ji būtų laikoma atviro kodo. Programos kodas turi būti viešai dalijamas pagal OSI patvirtintą licenciją.

Nors LLM kūrimas turi panašumų su programinės įrangos kūrimu, procesas nėra visiškai toks pats. Dėl to bendruomenėje kyla daug diskusijų apie atviro kodo apibrėžimą LLM kontekste. Kad modelis atitiktų tradicinį atviro kodo apibrėžimą, turėtų būti viešai prieinama ši informacija:

  • Duomenų rinkiniai, naudoti modelio mokymui.
  • Pilni modelio svoriai kaip mokymo dalis.
  • Vertinimo kodas.
  • Pritaikymo kodas.
  • Pilni modelio svoriai ir mokymo metrika.

Šiuo metu yra tik keli modeliai, atitinkantys šiuos kriterijus. OLMo modelis, sukurtas Allen Institute for Artificial Intelligence (AllenAI) yra vienas iš jų.

Šioje pamokoje toliau modelius vadinsime „atvirais modeliais“, nes jie gali neatitikti aukščiau nurodytų kriterijų rašymo metu.

Atvirų modelių privalumai

Labai pritaikomi - Kadangi atviri modeliai pateikiami su išsamia mokymo informacija, tyrėjai ir kūrėjai gali keisti modelio vidinę struktūrą. Tai leidžia kurti labai specializuotus modelius, pritaikytus konkrečiai užduočiai ar studijų sričiai. Kai kurie pavyzdžiai yra kodo generavimas, matematinės operacijos ir biologija.

Kaina - Naudojimo ir diegimo kaina už vieną žodį yra mažesnė nei nuosavybinių modelių. Kuriant generatyviosios AI programas, verta įvertinti našumą ir kainą, atsižvelgiant į jūsų naudojimo atvejį.

Modelio kaina
Šaltinis: Artificial Analysis

Lankstumas - Darbas su atvirais modeliais leidžia būti lankstiems naudojant skirtingus modelius arba juos derinant. Pavyzdys yra HuggingChat Assistants, kur vartotojas gali tiesiogiai vartotojo sąsajoje pasirinkti naudojamą modelį:

Pasirinkti modelį

Skirtingų atvirų modelių tyrinėjimas

Llama 2

LLama2, sukurtas Meta, yra atviras modelis, optimizuotas pokalbių programoms. Tai pasiekta naudojant pritaikymo metodą, kuris apima didelį kiekį dialogų ir žmonių atsiliepimų. Šis metodas leidžia modeliui generuoti rezultatus, labiau atitinkančius žmonių lūkesčius, taip užtikrinant geresnę vartotojo patirtį.

Kai kurie pritaikyti Llama versijų pavyzdžiai yra Japanese Llama, specializuotas japonų kalbai, ir Llama Pro, patobulinta bazinio modelio versija.

Mistral

Mistral yra atviras modelis, orientuotas į aukštą našumą ir efektyvumą. Jis naudoja ekspertų mišinio metodą, kuris sujungia grupę specializuotų ekspertų modelių į vieną sistemą, kurioje, priklausomai nuo įvesties, pasirenkami tam tikri modeliai. Tai leidžia efektyviau atlikti skaičiavimus, nes modeliai sprendžia tik tas užduotis, kuriose jie specializuojasi.

Kai kurie pritaikyti Mistral versijų pavyzdžiai yra BioMistral, orientuotas į medicinos sritį, ir OpenMath Mistral, atliekantis matematinius skaičiavimus.

Falcon

Falcon yra LLM, sukurtas Technology Innovation Institute (TII). Falcon-40B buvo apmokytas naudojant 40 milijardų parametrų, ir tai parodė geresnį našumą nei GPT-3 su mažesniu skaičiavimo biudžetu. Tai pasiekta naudojant FlashAttention algoritmą ir daugiaklausimų dėmesį, kuris sumažina atminties poreikius prognozavimo metu. Dėl šio sumažinto prognozavimo laiko Falcon-40B yra tinkamas pokalbių programoms.

Kai kurie pritaikyti Falcon versijų pavyzdžiai yra OpenAssistant, asistentas, sukurtas remiantis atvirais modeliais, ir GPT4ALL, kuris užtikrina geresnį našumą nei bazinis modelis.

Kaip pasirinkti

Nėra vieno teisingo atsakymo, kaip pasirinkti atvirą modelį. Geras pradžios taškas yra Azure AI Studio funkcija „filtruoti pagal užduotį“. Tai padės suprasti, kokio tipo užduotims modelis buvo apmokytas. Hugging Face taip pat palaiko LLM lyderių lentelę, kurioje pateikiami geriausiai pagal tam tikrus kriterijus veikiantys modeliai.

Norint palyginti LLM skirtingų tipų modelius, Artificial Analysis yra dar vienas puikus šaltinis:

Modelio kokybė
Šaltinis: Artificial Analysis

Jei dirbate su konkrečiu naudojimo atveju, efektyvu ieškoti pritaikytų versijų, orientuotų į tą pačią sritį. Eksperimentavimas su keliais atvirais modeliais, siekiant įvertinti jų veikimą pagal jūsų ir vartotojų lūkesčius, yra gera praktika.

Kiti žingsniai

Geriausia dalis apie atvirus modelius yra tai, kad galite pradėti dirbti su jais gana greitai. Peržiūrėkite Azure AI Foundry Model Catalog, kuriame yra speciali Hugging Face kolekcija su modeliais, aptartais šioje pamokoje.

Mokymasis nesibaigia čia, tęskite kelionę

Baigę šią pamoką, apsilankykite mūsų Generatyviosios AI mokymosi kolekcijoje, kad toliau gilintumėte savo žinias apie generatyviąją AI!


Atsakomybės apribojimas:
Šis dokumentas buvo išverstas naudojant dirbtinio intelekto vertimo paslaugą Co-op Translator. Nors siekiame tikslumo, atkreipiame dėmesį, kad automatiniai vertimai gali turėti klaidų ar netikslumų. Originalus dokumentas jo gimtąja kalba turėtų būti laikomas autoritetingu šaltiniu. Kritinei informacijai rekomenduojama naudotis profesionalių vertėjų paslaugomis. Mes neprisiimame atsakomybės už nesusipratimus ar klaidingus aiškinimus, kylančius dėl šio vertimo naudojimo.