1-bo‘lim

Transformer nima va u qayerdan paydo bo'ldi

RNN ning cheklovlari, 2017-yilgi maqola va uning sakkiz muallifi, e'tibor g'oyasi hamda transformerdan keyin nima o'zgargani.

🕑 6 daqiqa o‘qish 📄 946 so‘z 👁 2 marta ko‘rilgan
Ushbu bo‘lim mundarijasi
  1. RNN davri va uning devori
  2. 2017-yil: tavsiya emas, inqilob
  3. Natija
  4. Nima o'zgardi
  5. Asosiy g'oya - bir jumlada
  6. Xulosa

PyTorch darsligining 17-bo'limida matnni o'rtacha embedding bilan tasnifladik va o'sha yerda bitta kamchilik aytilgan edi: u usul so'z tartibini e'tiborga olmaydi. «Yaxshi emas» va «emas yaxshi» bir xil natija berardi.

Bu bo'limda o'sha muammoni hal qilgan arxitektura bilan tanishamiz.

RNN davri va uning devori #

2017-yilgacha matn bilan ishlash deyarli har doim rekurrent tarmoqlar (RNN, LSTM, GRU) orqali bajarilardi. Ular matnni so'zma-so'z, chapdan o'ngga o'qirdi va har qadamda «xotira»ni yangilab borardi.

Bu ishlardi, lekin ikkita jiddiy muammosi bor edi.

MuammoNima uchun
Ketma-ketlik50-so'zni hisoblash uchun avval 49 tasini hisoblash shart - parallellashtirib bo'lmaydi
Uzoq bog'liqlikJumla boshidagi so'z oxiriga yetguncha xotirada suyulib ketadi

Ikkinchisini bitta misolda ko'rish mumkin:

«Men bolaligimda Samarqandda yashagan va o'sha yerda maktabni tugatgan do'stim bilan kecha uchrashdim.»

«Uchrashdim» so'zi kimga tegishli? «Do'stim» ga. Lekin ular orasida 9 ta so'z bor. RNN bu masofani xotira orqali bosib o'tishi kerak - va u uzoqlashgan sari bu qiyinlashadi.

Eng achinarlisi - ketma-ketlik muammosi. GPU minglab amalni bir vaqtda bajara oladi, RNN esa undan foydalana olmaydi: 50-qadam 49-qadamni kutishi shart.

2017-yil: tavsiya emas, inqilob #

Jakob Uszkoreit - RNN ni self-attention bilan almashtirishni taklif qilgan (Google Research)

2017-yil, 12-iyun. Google da ishlaydigan guruh arXiv ga «Attention Is All You Need» nomli maqola joyladi. Sarlavhaning o'zi da'vo edi: e'tibor mexanizmining o'zi yetarli, rekurrensiya ham, konvolyutsiya ham kerak emas.

Maqolaning sakkizta muallifi bor va ularning izohida g'ayrioddiy jumla turadi: «Equal contribution. Listing order is random» - hissa teng, ro'yxat tartibi tasodifiy.

O'sha izohda kim nima qilgani ham yozilgan:

MuallifHissasi
Jakob UszkoreitRNN ni self-attention bilan almashtirishni taklif qildi va tekshiruvni boshladi
Ashish Vaswani, Illia PolosukhinBirinchi transformer modellarini loyihalashtirdi va yozdi
Noam ShazeerScaled dot-product va multi-head e'tiborni taklif qildi
Niki ParmarKo'plab model variantlarini sinab, sozlab chiqdi
Llion JonesDastlabki kod bazasi, tez bashorat va vizualizatsiya
Łukasz Kaiser, Aidan N. Gomeztensor2tensor ni yozdi va natijalarni sezilarli yaxshiladi
Noam Shazeer - scaled dot-product va multi-head e'tibor muallifi (Google Brain)
Sakkiz kishidan biri talaba edi

Aidan N. Gomez o'sha paytda Toronto universiteti talabasi bo'lib, Google Brain da amaliyot o'tayotgan edi. Illia Polosukhin esa maqolada umuman tashkilot ko'rsatmagan - faqat shaxsiy pochtasi yozilgan.

Sohani o'zgartirgan maqola shunday tuzilgan guruhdan chiqdi.

Natija #

Maqola o'z g'oyasini tarjima masalasida sinadi:

Ko'rsatkichNatija
WMT 2014 inglizcha-nemischa28.4 BLEU - oldingi eng yaxshi natijadan 2 BLEU dan ko'p yuqori
O'qitish vaqti3.5 kun, 8 ta GPU
Oldingi modellarga nisbatan xarajat«kichik bir ulushi»

Ikkinchi qator birinchisidan muhimroq. Sifat oshgani yaxshi, lekin asosiy yangilik shu: model parallel o'qitilardi, shuning uchun arzon va tez edi.

Bu narx masalasi emas - bu imkoniyat masalasi. Arzonlashgani uchun kattaroq model qurish mumkin bo'ldi. Kattalashgani sayin esa kutilmagan qobiliyatlar paydo bo'la boshladi.

Nima o'zgardi #

Bitta maqoladan keyin 2017 Transformer tarjima uchun 2018 BERT, GPT tayyor modellar 2019-2020 GPT-2, GPT-3 kattalashtirish 2022- suhbat modellari keng ommaga bugun matn, rasm, ovoz - bir arxitektura Hammasining ostida bitta g'oya turadi: e'tibor (attention) shuning uchun uni tushunsangiz, qolgani ustiga qurilgan qavatlar bo'lib qoladi
2017-yildagi arxitektura bugungi til modellarining hammasida yashaydi

Diqqat qiling: transformer tarjima uchun o'ylab topilgan edi. Bugun u matn yozadi, kod yozadi, rasm yaratadi va ovozni taniydi. Mualliflarning o'zlari ham bunday bo'lishini kutmagan edi.

Asosiy g'oya - bir jumlada #

E'tibor mexanizmi shunday ishlaydi: har bir so'z boshqa barcha so'zlarga qaraydi va ulardan qaysi biri o'ziga muhimligini o'zi hal qiladi.

Yuqoridagi jumlada «uchrashdim» so'zi «do'stim» ga to'g'ridan-to'g'ri qaraydi - oradagi 9 ta so'zdan o'tib yurishi shart emas. Masofa ahamiyatsiz bo'lib qoladi.

Va hamma so'z buni bir vaqtda qiladi - shuning uchun GPU to'liq ishlaydi.

RNNTransformer
O'qish tartibiSo'zma-so'z, ketma-ketHammasi bir vaqtda
Ikki so'z orasidagi masofaQadamlar soniga tengHar doim bitta qadam
GPU dan foydalanishCheklanganTo'liq
Uzun matn xarajatiChiziqliKvadratik (kamchiligi)

Oxirgi qator - transformerning narxi. Har so'z har so'zga qarasa, 100 ta so'z uchun 10 000 ta juftlik chiqadi. 4-bo'limda buni hisoblab ko'ramiz.

Bu darslikda nima quramiz

1-10 bo'limlar: e'tiborni qo'lda quramiz va undan ishlaydigan kichik GPT yasaymiz. Bu PyTorch darsligidagi «avval noldan» tartibining davomi.

11-20 bo'limlar: tayyor modellarga o'tamiz - transformers kutubxonasi, fine-tuning, semantik qidiruv va RAG.

Birinchi qism nima uchun kerak? Tayyor modelni ishlatish oson. Lekin u kutilmagan natija berganda, ichida nima borligini bilmasangiz, nima qilishni ham bilmaysiz.

Amaliy topshiriq
  1. RNN ning ikkita asosiy muammosini o'z so'zingiz bilan yozing.
  2. Uzoq bog'liqlikka o'zbek tilidan bitta misol toping.
  3. Nima uchun RNN ni parallellashtirib bo'lmasligini tushuntiring.
  4. «Attention Is All You Need» maqolasi qachon va qayerda chiqqanini yozing.
  5. Maqolaning sakkiz muallifidan uchtasini va ularning hissasini ayting.
  6. «Listing order is random» izohi nimani anglatishini tushuntiring.
  7. 28.4 BLEU va «3.5 kun, 8 GPU» dan qaysi biri muhimroq - fikringizni asoslang.
  8. Transformer dastlab qaysi masala uchun yaratilganini yozing.
  9. E'tibor mexanizmining asosiy g'oyasini bitta jumlada ifodalang.
  10. Transformerning kvadratik xarajati nimadan kelib chiqishini tushuntiring.

Xulosa #

  • 2017-yilgacha matn bilan ishlashda RNN va LSTM hukmron edi.
  • Ularning ikki muammosi bor: ketma-ketlik va uzoq bog'liqlikning susayishi.
  • RNN ni parallellashtirib bo'lmaydi - 50-qadam 49-qadamni kutadi.
  • 2017-yil 12-iyun: «Attention Is All You Need» maqolasi chiqdi.
  • Sakkiz muallif teng hissa qo'shgan, ro'yxat tartibi ataylab tasodifiy.
  • Self-attention g'oyasini Jakob Uszkoreit, multi-head e'tiborni Noam Shazeer taklif qilgan.
  • Model 28.4 BLEU berdi, lekin asosiy yangilik - 3.5 kunda, 8 GPU da o'qitilgani.
  • Arzonlashuv kattaroq modellarga yo'l ochdi va bu bugungi til modellariga olib keldi.
  • E'tiborning mohiyati: har so'z barcha so'zlarga qaraydi va muhimini o'zi tanlaydi.
  • Buning narxi - uzun matnda kvadratik xarajat.

Keyingi bo'limda matnni modelga tushunarli qilish - tokenizatsiya bilan boshlaymiz va o'zbek tili bunda qanchaga tushishini o'lchaymiz.

Xatolik topdingizmi?

Imlo xatosi, ishlamaydigan kod yoki noto‘g‘ri ma‘lumotni ko‘rsangiz - bizga xabar bering. Har bir xabar administrator tomonidan ko‘rib chiqiladi.