Skip to content

Latest commit

 

History

History
178 lines (128 loc) · 5.85 KB

File metadata and controls

178 lines (128 loc) · 5.85 KB

Transkripcijos duomenų paruošimas

Transkripcijos duomenų paruošimo scenarijai atsisiunčia „YouTube“ vaizdo įrašų transkripcijas ir paruošia jas naudoti su pavyzdžiu „Semantinė paieška su OpenAI Embeddings ir Functions“.

Transkripcijos duomenų paruošimo scenarijai buvo išbandyti su naujausiomis Windows 11, macOS Ventura ir Ubuntu 22.04 (ir naujesnėmis) versijomis.

Sukurkite reikalingus Azure OpenAI Service išteklius

Important

Rekomenduojame atnaujinti Azure CLI į naujausią versiją, kad būtų užtikrintas suderinamumas su OpenAI Žiūrėkite dokumentaciją

  1. Sukurkite išteklių grupę

Note

Šiose instrukcijose naudojame išteklių grupę „semantic-video-search“ Rytų JAV regione. Galite pakeisti išteklių grupės pavadinimą, tačiau jei keičiate išteklių vietą, patikrinkite modelių prieinamumo lentelę.

az group create --name semantic-video-search --location eastus
  1. Sukurkite Azure OpenAI Service išteklių.
az cognitiveservices account create --name semantic-video-openai --resource-group semantic-video-search \
    --location eastus --kind OpenAI --sku s0
  1. Gaukite galinį tašką ir raktus, reikalingus šiai programai
az cognitiveservices account show --name semantic-video-openai \
   --resource-group  semantic-video-search | jq -r .properties.endpoint
az cognitiveservices account keys list --name semantic-video-openai \
   --resource-group semantic-video-search | jq -r .key1
  1. Įdiekite šiuos modelius:
    • text-embedding-ada-002 versija 2 arba naujesnė, pavadinta text-embedding-ada-002
    • gpt-35-turbo versija 0613 arba naujesnė, pavadinta gpt-35-turbo
az cognitiveservices account deployment create \
    --name semantic-video-openai \
    --resource-group  semantic-video-search \
    --deployment-name text-embedding-ada-002 \
    --model-name text-embedding-ada-002 \
    --model-version "2"  \
    --model-format OpenAI \
    --scale-settings-scale-type "Standard"
az cognitiveservices account deployment create \
    --name semantic-video-openai \
    --resource-group  semantic-video-search \
    --deployment-name gpt-35-turbo \
    --model-name gpt-35-turbo \
    --model-version "0613"  \
    --model-format OpenAI \
    --sku-capacity 100 \
    --sku-name "Standard"

Reikalinga programinė įranga

Aplinkos kintamieji

Toliau nurodyti aplinkos kintamieji yra būtini norint paleisti „YouTube“ transkripcijos duomenų paruošimo scenarijus.

Windows sistemoje

Rekomenduojame kintamuosius pridėti prie savo user aplinkos kintamųjų. Windows Start > Redaguoti sistemos aplinkos kintamuosius > Aplinkos kintamieji > Vartotojo kintamieji [USER] > Naujas.

AZURE_OPENAI_API_KEY  \<your Azure OpenAI Service API key>
AZURE_OPENAI_ENDPOINT \<your Azure OpenAI Service endpoint>
AZURE_OPENAI_MODEL_DEPLOYMENT_NAME \<your Azure OpenAI Service model deployment name>
GOOGLE_DEVELOPER_API_KEY = \<your Google developer API key>

Linux ir macOS sistemose

Rekomenduojame šiuos eksportus pridėti į savo ~/.bashrc arba ~/.zshrc failą.

export AZURE_OPENAI_API_KEY=<your Azure OpenAI Service API key>
export AZURE_OPENAI_ENDPOINT=<your Azure OpenAI Service endpoint>
export AZURE_OPENAI_MODEL_DEPLOYMENT_NAME=<your Azure OpenAI Service model deployment name>
export GOOGLE_DEVELOPER_API_KEY=<your Google developer API key>

Įdiekite reikiamas Python bibliotekas

  1. Įdiekite git klientą, jei jis dar neįdiegtas.

  2. Atidarykite Terminal langą ir nukopijuokite pavyzdį į norimą repo aplanką.

    git clone https://github.com/gloveboxes/semanic-search-openai-embeddings-functions.git
  3. Pereikite į data_prep aplanką.

    cd semanic-search-openai-embeddings-functions/src/data_prep
  4. Sukurkite Python virtualią aplinką.

    Windows sistemoje:

    python -m venv .venv

    macOS ir Linux sistemose:

    python3 -m venv .venv
  5. Aktyvuokite Python virtualią aplinką.

    Windows sistemoje:

    .venv\Scripts\activate

    macOS ir Linux sistemose:

    source .venv/bin/activate
  6. Įdiekite reikiamas bibliotekas.

    Windows sistemoje:

    pip install -r requirements.txt

    macOS ir Linux sistemose:

    pip3 install -r requirements.txt

Paleiskite „YouTube“ transkripcijos duomenų paruošimo scenarijus

Windows sistemoje

.\transcripts_prepare.ps1

macOS ir Linux sistemose

./transcripts_prepare.sh

Atsakomybės atsisakymas:
Šis dokumentas buvo išverstas naudojant dirbtinio intelekto vertimo paslaugą Co-op Translator. Nors siekiame tikslumo, prašome atkreipti dėmesį, kad automatiniai vertimai gali turėti klaidų ar netikslumų. Originalus dokumentas jo gimtąja kalba turėtų būti laikomas autoritetingu šaltiniu. Kritinei informacijai rekomenduojame profesionalų žmogaus vertimą. Mes neatsakome už nesusipratimus ar neteisingą interpretavimą, kilusį dėl šio vertimo naudojimo.