Skip to main content

Common Voice Қазақша

· 4 min read

English version is here.

Жаңарту (2026)

Бұл жазба жарияланғаннан бері жақсы жаңалық: қазақ тілі Common Voice-та іске қосылды және үлес қосуға ашық. Төмендегі 2019 жылғы жазба шақыратын еңбектің арқасында — интерфейсті аудару және сөйлемдер жинау — қазақ тілінің тасымалдаушыларының көмегімен тіл іске қосылды. 26.0 нұсқасы бойынша, үлес қосушылар бірнеше сағат тексерілген аудио жинады — шағын, бірақ нақты бастама. Дауысыңызды қазір commonvoice.mozilla.org/kk сайтында қоса аласыз.

Төмендегі 2019 жылғы жазба сол тарихтың бір бөлігіне айналды.

Google Assistant немесе Yandex Alisa қазақ тілінде де сөйлесе, керемет болмас па еді?

Мұндай сөйлесетін ассистенттердің қажетті компоненті болып сөйлеуді тану (ағылшыншасы “speech recognition”) немесе сөйлеуді мәтінге (ағылшыншасы “speech-to-text”) деп аталатын жүйе табылады.

Машина оқыту методтарымен бір тіл үшін жақсы сапалы сөйлеу тану жүйесін болдыру үшін, ол тілде даустық деректердің аса үлкен көлемі (мыңдаған сағат, төменде қараңыз) болуы қажет. Бұдан басқа, ол деректер әртүрлі адамдар тарапынан жазылған болуы және транскрипцияланған болуы керек. Осы уақытқа дейін, тиісті лицензиялі аудиодеректердің болмауы себепті, көпшілік тілдер үшін ерікті / ашық бастапқы кодты сөйлеуді тану жүйесі қол жетімсіз болып қала береді.

Жаңарту (2026)

Whisper сияқты алдын ала үйретілген модельдер мен файн-тюнингтің арқасында, бастапқы Whisper қолдамайтын тіл үшін дәл сөйлеу тану жүйесін болдыруға қажет деректер көлемі бүгінде әлдеқайда азырақ — мыңдаған емес, ондаған сағат шамасында. Мұның мысалдарын осы блогтың кейінгі жазбаларынан қараңыз.

Бақытымызға орай, бұл жағдайды жақсы жаққа өзгертуге болады. 2018 жылы Mozilla, Firefox веб-браузері және көптеген басқа бағдарламалардың артындағы компания, Common Voice (“Халық дауысы”) жобасын іске қосты.

Common Voice деген не?

Міне, ол жобаның About бетінен бір үзінді:

Common Voice — бүкіл әлемдегі ерікті үлес қосушылардың дауыстарынан құралған, жалпыға қолжетімді дауыс деректер жиынтығы. Дауыстық бағдарламалар жасағысы келетіндер бұл деректер жиынтығын машина оқыту модельдерін үйрету үшін қолдана алады.

Сіз қалай көмектесе аласыз?

Біз Taruen ретінде қазақ тіліндегі Common Voice-ты іске қосқымыз келеді, және бұл мақсатқа қарай алғашқы қадамдарды жасадық. Бірақ Common Voice-та қазақ тілі де іске қосылсын үшін, қазақ тілін жақсы білушілердің көмегі керек. Егер қазақ тілі ана тіліңіз болса, мына қалай көмектесе аласыз:

  1. Common Voice сайты Pontoon атты Mozilla-дың локализация құралында дұрыс аударылған ма жоқ па екенін тексеріңіз. Аудармалардың шамамен үштен бірін біз — яғни қазақ тілі ана тілі болмаған адамдар — үстедік, сондықтан олар қателі болуға мүмкін.

  2. Біз Common Voice-тың сөйлем жинау құралына жіберген сөйлемдерді тексеріңіз. Бір тіл Common Voice-та іске қосылсын үшін, ол тілде ең азы 5000 тексерілген сөйлем болу қажет.

Бұл сөйлемдерді біз М. Әуезов атындағы Әдебиет және өнер институты жариялаған “Бабалар сөзі” деп аталатын, қазақ халық шығармашылығы туындыларын өз ішіне алған мықты 100 томдықтың 65 және 68 томдарынан алдық (65-68 томдарда мақалдар жиналған). Қазақстан Республикасының Авторлық құқық туралы заңының 8-нші бабына сәйкес, фольклор шығармалары авторлық құқықтан азат және осылайша қоғамдық байлық (public domain) болып тұр. Демек, оларды Common Voice-та қолдануға болады. Сонымен, 65-68-нші томдар ішіндегі мақал-мәтелдер Common Voice жобасының басқа критерийлеріне де сәйкес келеді — оларда сандар, шетелдік әріптер және рұқсат етілмеген басқа белгілер жоқ, олар әдетте қысқа, педагогикалық / қызықты және осылайша оқу үшін көңілді.

Common Voice талап ететін орфография мен грамматиканың дұрыстығын тексеруден басқа, біз сізден ол сөйлемдер кімді де болса ренжітпейтінін тексеруіңізді өтінеміз. Басқаша айтқанда, ол сөйлемдерде ерлерге, әйелдерге, ата-аналарға, балаларға, діни адамдарға, діни емес адамдарға, Оңтүстік Қазақстандықтарға, Солтүстік Қазақстандықтарға, Батыс Қазақстандықтарға, Шығыс Қазақстандықтарға, Қытайдың қазақтарына… түсінесіз шығар — тіл тигізетін заттардың болмауы қайырлы. Ол сөйлемдерден көз жүгірткенде ондайларын көрмедік, бірақ бұл сұраққа да қазақша жақсы білетін адамдар ғана жауап бере алады.

Бірге, қалаған әр адам да қазақ тілін түсінуші сөйлеу тану жүйесін болдыра аларлық көлемде аудиодеректер жинай аламыз деген үміттеміз. Жобаның жиі қойылатын сұрақтар бетінде мозиллашылар жақсы сапалы сөйлеу тану жүйесін нөлден үйрету үшін шамамен 10000 сағат тексерілген аудиожазбалар қажет деп жазады. Демек бұл — мақсат. 10000 сағат қолжетпестік көп сияқты, бірақ 10 мың сағатты қазақша білушілердің ең консерватив санына бөлсек те, кісі басына шамамен 4 секунд аудио тура келеді. Ал 4 секунд — ол әлдеқайда азырақ қорқынышты сан.

(Жоғарыдағы Жаңартуда айтылғандай, Whisper сияқты алдын ала үйретілген модельді файн-тюнинг жасауға әлдеқайда аз дерек керек — бірақ дерек көп болғаны еш зиян етпейді, әрі үлкен, ашық лицензиялы қазақ дауыс деректер жиынтығы модельдер қалай үйретілсе де құнды болып қала береді.)