Bütün yazılar

Data Scientist Olmaq: Sıfırdan 7 Addımlıq Yol Xəritəsi

Tələblər siyahısı bitmir: Python, SQL, ML, LLM, MLOps... Data scientist olmaq üçün hansı ardıcıllıqla getməli olduğunuzu göstəririk.

Fərid Mustafayev8 dəq oxu

Data scientist ekranında model nəticələri və qrafiklər

Kaggle-da bir neçə notebook açmısınız, Titanic datasetində model qurmusunuz, "machine learning" kursunu bitirmisiniz. Amma data scientist vakansiyalarına baxanda tələblər siyahısı bitmək bilmir: Python, SQL, statistika, deep learning, MLOps, LLM... Haradan başlamalı və hansı ardıcıllıqla? Bu bələdçidə data scientist olmaq üçün 7 addımlıq praktik yol xəritəsi təqdim edirik — hər addımda nəyi öyrənməli, nəyi qurmalı və hansı səhvlərdən qaçmalı olduğunuzu göstərərək.

Qısa cavab: Data scientist olmaq üçün Python və SQL ilə başlayın, statistika və data təhlili əsaslarını qurun, sonra klassik maşın öyrənməsi modellərinə, onların qiymətləndirilməsinə və izahına keçin. Ardınca dərin öyrənmə, LLM tətbiqləri və modelin production-a çıxarılmasını öyrənin. Hər mərhələdə real biznes probleminə əsaslanan layihə qurun və nəticəni izah etməyi məşq edin.

Bu bələdçi kimə lazımdır?

  • Riyaziyyat, statistika, iqtisadiyyat və ya mühəndislik fonu olub data science-ə keçmək istəyənlər
  • Data analitik kimi işləyib modelləşdirməyə keçmək istəyənlər
  • Kursları bitirib, amma real layihəsi olmayanlar

Data analitika ilə data science arasında hələ seçim edirsinizsə, əvvəlcə data analyst vs data scientist müqayisəmizə baxın.

Data scientist nə edir? Qısa xatırlatma

Data scientist datadan biznes qərarlarına təsir edən nəticə və modellər çıxarır: hansı müştəri tərk edəcək, hansı əməliyyat dələduzluqdur, gələn ay satış nə qədər olacaq, hansı kampaniya həqiqətən təsir edib. İş təkcə model qurmaq deyil — düzgün sualı qoymaq, datanı hazırlamaq, modeli qiymətləndirmək və nəticəni qeyri-texniki insanlara izah etmək də bura daxildir.

Addım 1: Python və SQL — iş alətləri

Data science-in gündəlik dili Python-dur: pandas ilə cədvəllər, NumPy ilə hesablamalar, matplotlib/seaborn ilə qrafiklər. SQL isə datanın yaşadığı yerdən — şirkət bazalarından — onu çıxarmaq üçündür.

Meyar: Bir CSV faylını yükləyib təmizləyə, qruplaşdıra, birləşdirə və qrafikləşdirə bilirsinizsə, SQL-də JOIN, GROUP BY və pəncərə funksiyalarını yazırsınızsa, növbəti addıma keçin.

Addım 2: Statistika və data təhlili

Model qurmazdan əvvəl datanı başa düşmək lazımdır. Əsas anlayışlar: paylanmalar, orta/median/standart sapma, korrelyasiya və səbəbiyyət fərqi, hipotez testləri, nümunə seçimində qərəz.

Tipik səhv: korrelyasiyanı səbəb kimi oxumaq. "Tətbiqi çox açan müştəri az tərk edir" — bu, tətbiqin tərk etməni azaltdığını sübut etmir.

Addım 3: Klassik maşın öyrənməsi

Reqressiya, qərar ağacları, ensemble metodları (random forest, gradient boosting), klasterləşdirmə. Burada kitabxananı çağırmaq asandır; çətin olan bunlardır:

  • Feature engineering: xam datadan modelin istifadə edə biləcəyi əlamətlər yaratmaq
  • Qiymətləndirmə: düzgün metrik seçmək (dələduzluq aşkarlamada accuracy yanıldıcıdır)
  • Data sızması (leakage): gələcək məlumatın təlim datasına düşməsi
  • İzahlılıq: modelin niyə belə qərar verdiyini göstərmək

Addım 4: Zaman sıraları, səbəbiyyət və seqmentasiya

Real biznes suallarının böyük hissəsi bu üç mövzuya düşür: proqnoz (gələn ay nə olacaq?), təsir (kampaniya həqiqətən işlədi?), seqmentasiya (müştərilərimiz kimlərdir?). Bu mövzular data scientist-i "model quran" insandan "biznes sualına cavab verən" insana çevirir.

Addım 5: Dərin öyrənmə və LLM-lər

Neyron şəbəkələr, mətn və təsvir üzərində modellər, transformerlər. Son illərdə data scientist-lərdən LLM tətbiqləri və RAG sistemləri ilə işləmək də getdikcə daha çox gözlənilir. Açıq yol xəritəsi kimi roadmap.sh-in AI and Data Scientist bölməsi faydalı istinad nöqtəsidir.

Addım 6: Production və MLOps

Notebook-da işləyən model biznes üçün hələ dəyər yaratmır. Onu xidmətə çevirmək, versiyalamaq, monitorinq etmək və data dəyişdikdə yenidən öyrətmək lazımdır. Junior səviyyədə bunu dərindən bilmək tələb olunmaya bilər, amma əsas anlayışlar sizi digər namizədlərdən fərqləndirir.

Addım 7: Portfolio və nəticəni izah etmək

Data science portfoliosunda ən güclü siqnal "model accuracy 0.94" deyil, belə bir hekayədir: "Problem bu idi, data bu idi, bu yanaşmanı seçdim, çünki..., nəticə biznes üçün bu deməkdir, məhdudiyyətlər bunlardır."

Hər layihə üçün:

  • Aydın biznes sualı
  • Datanın təmizlənməsi və araşdırılması
  • Ən azı iki yanaşmanın müqayisəsi
  • Nəticənin qeyri-texniki dillə xülasəsi

Portfolionun necə qurulacağını developer portfolio qurmaq bələdçimizdə ətraflı göstərmişik.

Ən çox edilən 5 səhv

  1. Birbaşa deep learning-dən başlamaq. Əsaslar olmadan mürəkkəb modellər "qara qutu" olaraq qalır.
  2. Yalnız təmiz datasetlərdə işləmək. Real data qarışıqdır; təmizləmə işin böyük hissəsidir.
  3. Metrikanı biznesdən ayırmaq. Yüksək accuracy biznes problemini həll etməyə bilər.
  4. Nəticəni izah etməmək. İzah olunmayan model istifadə olunmur.
  5. Notebook-da qalmaq. Heç olmasa bir layihəni sadə API və ya tətbiq kimi təqdim edin.

Devlab-ın Data Science proqramı: yol xəritəsi praktikada

Yuxarıdakı addımları tək getmək mümkündür, amma real tapşırıq və kənar rəy olmadan çox vaxt aparır. Bunu Devlab komandası sizin üçün qura bilər. Data Science proqramı minimum 3 ay davam edir və 13 moduldan ibarətdir, hər biri real biznes probleminə əsaslanır və mentor tərəfindən yoxlanılır:

  1. Explainable Ensemble Modeling & Real-Time Insights
  2. Advanced Feature Engineering & Time Series Modeling
  3. Multi-Modal Deep Learning Integration
  4. Causal Inference & Streaming Analytics
  5. Causal Inference, Reinforcement Learning & Feature Stores
  6. Multi-Source Data Modeling & Geospatial Insights
  7. Regional Analytics, Customer Segmentation & Career Prep
  8. Large Language Models & Geospatial Risk Modeling
  9. Scalable ML Pipelines & Custom Deep Models
  10. LLM Applications & RAG Systems
  11. AI Agents & Tool Use
  12. MLOps & Model Monitoring
  13. Capstone II: Production ML/AI System

Python üzrə əlavə bonus modulu da var. Hər həftə mentor işinizi yoxlayır, həftəlik canlı görüşlər keçirilir.

Nümunə layihə: ideyadan təqdimata qədər

Yol xəritəsinin addımlarını bir layihədə necə birləşdirmək olar — bank müştərilərinin kredit ödənişini gecikdirmə riskinin proqnozu:

  1. Biznes sualı: "Hansı müştərilər növbəti ödənişi gecikdirə bilər və bank nə edə bilər?"
  2. Data: açıq kredit datasetini SQL və pandas ilə yükləyin, boşluqları və uyğunsuzluqları təmizləyin
  3. Araşdırma: gecikmə ilə əlaqəli ola biləcək əlamətlərə baxın, amma korrelyasiyanı səbəb kimi oxumayın
  4. Model: sadə bazis model (məsələn, logistik reqressiya) qurun, sonra gradient boosting ilə müqayisə edin
  5. Qiymətləndirmə: riskli müştəriləri tapmaq vacibdirsə, accuracy yox, recall və precision balansına baxın
  6. İzah: hansı əlamətlərin qərara ən çox təsir etdiyini göstərin
  7. Təqdimat: "Model ən riskli müştərilərin çoxunu aşkarlayır; bank bu qrupa əvvəlcədən xatırlatma göndərə bilər; məhdudiyyətlər bunlardır" formatında qısa xülasə

Bu layihə Python, SQL, statistika, ML, qiymətləndirmə və ünsiyyət bacarıqlarını bir yerdə göstərir.

Həftəlik ritm: öyrənməni necə təşkil etməli?

Data science geniş sahədir və hər şeyi eyni anda öyrənməyə çalışmaq yorur. Sağlam həftəlik ritm belə ola bilər:

  • 2–3 gün: yeni anlayış (məsələn, zaman sıraları və ya model qiymətləndirmə)
  • 2–3 gün: həmin anlayışı real data üzərində tətbiq etmək
  • 1 gün: nəticəni yazmaq — README, qrafiklər, qısa xülasə — və rəy almaq

Ən çox atlanan üçüncü gündür, halbuki işəgötürən üçün ən görünən məhz odur.

Data scientist-in alət dəsti: nədən başlamalı?

Bazarda alət çoxdur, amma başlanğıc üçün əsas dəst kiçikdir:

KateqoriyaBaşlanğıc alətlərNə vaxt lazımdır
Data emalıpandas, NumPy, SQLİlk gündən
Vizuallaşdırmamatplotlib, seabornİlk gündən
Klassik MLscikit-learnAddım 3
Boosting modelləriXGBoost, LightGBMAddım 3–4
Dərin öyrənməPyTorch və ya TensorFlowAddım 5
LLM tətbiqləriLLM API-ləri, embedding-lərAddım 5
ProductionDocker, sadə API, model monitorinqiAddım 6
İş mühitiJupyter, Gitİlk gündən

Əsas qayda: bir kateqoriyada bir aləti dərindən öyrənin. Kateqoriyanın məntiqini başa düşsəniz, ikinci alət günlər içində öyrənilir.

Müsahibədə data scientist-dən nə soruşulur?

Junior data science müsahibələrində adətən bu mövzular gəlir: overfitting və onunla mübarizə, təlim və test datasının ayrılması, metrik seçimi (niyə accuracy həmişə uyğun deyil), korrelyasiya ilə səbəbiyyət fərqi, data sızması, və ən vacibi — öz layihənizi biznes dilində izah etmək. Texniki suallardan çox "bu modeli biznesə necə təqdim edərdiniz?" sualı fərqləndirici olur.

Data science-ə başqa sahədən keçənlər üçün

İqtisad, maliyyə, mühəndislik və ya tibb fonu data science-də ciddi üstünlükdür: siz biznes sualını və datanın kontekstini artıq başa düşürsünüz. Keçid zamanı ilk layihələri öz sahənizdən seçin — məsələn, iqtisadçı üçün kredit riski, mühəndis üçün avadanlıq nasazlığının proqnozu. Belə layihələr həm daha keyfiyyətli olur, həm də müsahibədə sizi fərqləndirir.

Ən yaxşı başlanğıc layihəsi sizin sahə bilginizin data science ilə kəsişdiyi yerdədir — orada siz digər junior namizədlərin görmədiyi sualları görə bilirsiniz.

Belə layihə müsahibədə də ən təbii söhbət mövzusuna çevrilir, çünki onun hər detalını real təcrübənizdən izah edə bilirsiniz.

Nəticə

Data scientist olmaq bir kurs deyil, ardıcıl yoldur: Python və SQL → statistika → klassik ML → zaman sıraları və səbəbiyyət → dərin öyrənmə və LLM → production → portfolio. Hər addımda real problem üzərində işləyin və nəticəni izah etməyi məşq edin — işəgötürəni ən çox inandıran budur.

Data Science yoluna real tapşırıqlarla başlamaq istəyirsinizsə, pulsuz qeydiyyatdan keçin və 3 real tapşırıq nümunəsini öhdəliksiz görün. Sualınız varsa, komandamızla əlaqə saxlayın.

Tez-tez verilən suallar

Data scientist olmaq üçün riyaziyyat diplomu lazımdır?

Diplom məcburi deyil, amma statistika, ehtimal və xətti cəbrin əsaslarını bilmək lazımdır. Bu bilikləri praktik layihələrlə paralel öyrənmək mümkündür.

Data science üçün Python yoxsa R?

Hər ikisi istifadə olunur, amma Python sənayedə daha geniş yayılıb və production sistemlərinə inteqrasiyası daha asandır. Başlanğıc üçün Python tövsiyə olunur.

Data scientist olmaq nə qədər vaxt aparır?

Bu, başlanğıc səviyyənizdən və ayırdığınız vaxtdan çox asılıdır. Devlab-ın Data Science proqramı minimum 3 ay davam edir; əvvəlcədən Python və statistika əsaslarınız varsa, proqramdan daha çox fayda götürəcəksiniz.

Data science-də junior iş tapmaq çətindirmi?

Bu sahədə junior vəzifələr adətən digər sahələrə nisbətən daha çox hazırlıq tələb edir. Bəzi namizədlər əvvəlcə data analitik kimi başlayıb sonra modelləşdirməyə keçir. Real biznes problemlərinə əsaslanan, izah olunmuş layihələr şansı ciddi artırır.

Bu mövzuda təcrübə proqramı