Lõputeemade seminarid:
matemaatika: 28. septembril kell 16.15 ruumis 1021
matemaatiline statistika: 5. oktoobril kell 16.15 ruumis 1021
Analüütilisest mehaanikast tuntud Hamiltoni dünaamika abil teostatud Markovi ahela Monte Carlo meetodi tundmaõppimine ja rakendamine osakestefüüsika mudelite uurimisel (füüsikalise parameetrite ruumi leidmine).
O(N) sümmeetriaga stohhastiliste skalaarväljade uurimine: välja väärtuste jaotusfunktsiooni ja korrelatsioonifunktsioonide leidmine. (Matemaatika hõlmab Langevini võrrandit. Teemat rakendatakse kosmilise inflatsiooni uurimisel.)
Kolme keha probleemi numbriline uurimine: vaadelda kolme keha probleemi erinevaid algtingimusi ja lõppolekuid, milleni nad viivad; antud algolekute statistilise jaotuse korral anda lõppolekute statistiline jaotus (rakendatakse näiteks paaris mustade aukude tekke uurimisel). Eeldab programmeerimisoskust.
Täpsemalt siin: https://kodu.ut.ee/~abramov/et/seminar/geometry-topology.html
Pakun bakalaureuse- ja magistritööde teemadeks diferentsiaalvõrrandite tekkimise ning lahendamisega seotud probleeme, mida kursuses "Diferentsiaalvõrrandid" ei käsitleta või millele kursuse piiratud ajaraamide tõttu saab pöörata vähe tähelepanu. Pean siin silmas näiteks harilike diferentsiaalvõrrandite mitmepunkti rajaülesandeid, kus võrrandile lisatavad tingimused on seotud mitte ainult uuritava funktsiooni väärtustega integreerimislõigu otspunktides, vaid ka väärtustega integreerimislõigu sisepunktides. Väga huvitav oleks ka murrulise tuletise mõistega seotud temaatika, eriti murrulist järku tuletisi sisaldavate diferentsiaalvõrrandite lahendamisega seotud küsimused (võrrandi lahendi olemasolu ja ühesus, lahendi siledus, kõrget järku täpsusega numbriliste meetodite konstrueerimine). Viimasel ajal on see temaatika omandanud suure aktuaalsuse, sest on selgunud, et murrulist järku tuletistega diferentsiaalvõrrandid modelleerivad mitmesuguste reaalse elu protsesside ja materjalide käitumist paremini, kui täisarvulist järku tuletistega diferentsiaalvõrrandid. Murruliste tuletistega seotud valdkonnas on ka meie instituudis saadud olulisi teadustulemusi (vt näiteks Gennadi Vainikko "Which functions are fractionally differentiable?", ZAA 35(2016), lk. 465-487). Tundub, et praegu on hea võimalus jätkata murrulist järku tuletisi sisaldavate diferentsiaalvõrrandite teoreetilist- ja/või numbrilist analüüsi. Olen valmis koos oma noorte kolleegide Kaido Läti ja Mikk Vikerpuuriga juhendama uurimistöid eespool kirjeldatud valdkondades.
Mina olen Ago-Erik Riet ja minu huvid on kombinatoorika, kodeerimisteooria, lõplik geomeetria, tõenäosus ja nende potentsiaalsed rakendused arvutisüsteemides. Ma kuulun kodeerimisteooria uurimisrühma, mille liikmed on matemaatika ja statistika ja arvutiteaduse instituutides. Minuga saab ühendust kõige kindlamini e-maili teel [email protected].
Suured firmad nagu Google ja Amazon talletavad andmeid hajusandmetalletussüsteemis. Selline süsteem peaks olema töökindel, turvaline ja mitte liiga kallis. Partiikood (batch code) võimaldab säilitada kuuma ehk paljunõutud infot, vähendades serverite koormust. Näiteks kolm serverit vastavalt bittidega a, b ja a+b võimaldavad eraldi serveritest korraga serveerida kaht a päringut kui a ja b+(a+b), kaht b päringut analoogiliselt ja ka päringuid a ja b korraga, vähendades talletusmahtu: selleks pole vaja nelja serverit bittidega a, a, b ja b. Bakalaureusetöö teema puudutab partiikoode ja olenevalt Sinu huvidest kas nende algebralisi/kombinatoorseid, algoritmilisi või tõenäosuslikke aspekte.
Autoriõigustega kaitstud sisu koopiaid on võimalik vesimärkida, nii et kui mitu kasutajat kombineerivad oma koopiaid piraatkoopia tekitamiseks, siis on võimalik vähemalt üks selline kasutaja (või ka kõik) kindlaks teha. Vaatame selle probleemi versiooni, kus soovime kindlaks teha vähemalt k piraati, kui piraate kokku on ülimalt t. Piraatidel on piraatkoopia tekitamiseks kasutada oma vesimärgitud koopiate ühend. Kombinatoorne (uudne) tingimus, mida soovime vaadata: iga ühend vähemalt k-st ja ülimalt t-st vesimärgitud koopiast määrab üheselt mingid k nendest koopiatest. Meid huvitab sellisel tingimusel maksimaalne vesimärgitud koopiate arv, mida üldse saab välja jagada. Bakalaureusetöö teema puudutab selliste kombinatoorsete konfiguratsioonide (hüpergraafid/koodid) konstrueerimist ja nende arvule ülemtõkete tõestamist, toetudes kirjandusele veidi erinevate analoogiliste probleemide kohta.
Astronoomia valdkonda puudutavas uurimistöös koostatakse matemaatiline mudel, mis kirjeldab kahe järjestikuse täheparvede põlvkonna suhtelist liikumist galaktikas. Füüsikaliseks lähtekohaks on olukord, kus esimese põlvkonna massiivsete tähtede supernoovad tekitavad paisuva supermulli. Selle servas võib tihenenud gaasist tekkida uus täheparv, mistõttu teise põlvkonna algasukoht on esimese suhtes nihkes. Uurimistöö põhiküsimus oleks "Kuidas muutub kahe eri põlvkonda kuuluva täheparve vaheline kaugus ajas, kui nende algtingimused ja orbiidid on veidi erinevad?" Töös saaks ühendada diferentsiaalvõrrandid, dünaamilised süsteemid, analüütilise käsitluse ja numbrilised simulatsioonid.
Olen ise spetsialiseerunud funktsionaalanalüüsi teemade uurimisele, kuid matemaatiline innovatsioon sünnib tihti mitme eri matemaatika valdkonna ühendamisel. Kuna ka minu enda huvi on laiemalt matemaatika vastu, siis olen huvitatud juhendama erinevaid lõputöid, mis on seotud nii funktsionaalanalüüsiga kui ka mõne teise matemaatika valdkonnaga. Huvi korral kirjuta või astu läbi kabinetist 4088. Täpsem teema sõltub tudengi enda huvist, ambitsioonist ja eelnevatest teadmistest.
E-kiri: [email protected]
Kui tavaliselt on sümmeetrilise jaotuse tõenäosustihedus ühemõõtmelisel juhul kellukesekujuline, siis Kotzi jaotuse korral on see üldjuhul kahe tipuga, kahemõõtmelisel juhul "auguga" keskel. Üllataval kombel on sellel mitmeid rakendusi, näiteks antropomeetriliste andmete kirjeldamisel (mehed-naised, poisid tüdrukud).
Selle teema valimisel saab teha tööd nii paberi ja pliiatsiga valemite tuletamisel kui simulatsioonide teostamisel arvutil. Kindlasti oleks hea leida ka andmestik, mille kirjeldamiseks on Kotzi jaotus sobivaks mudeliks.
Kahe juhusliku jada pikima ühisjada pikkust on uuritud juba mitukümmend aastat aga paljud küsimused selle kohta on senini veel vastuseta. Chvatál ja Sankoff näitasid, et teatud üldistel tingimustel pikima ühisjada pikkuse ja jadade pikkuse suhe koondub konstandiks (nn Chvatál-Sankoffi konstant). Selle konstandi täpne väärtus ei ole teada ühegi mudeli korral, aga simulatsioonid on näidanud, et näiteks sõltumatute mündivisete korral on see ligikaudu 0.81. Bakalaureusetöö eesmärk on uurida Monte Carlo simulatsioonide abil keskmise pikima ühisjada pikkuse asümptootilist käitumist ning võrrelda saadud tulemusi teadaolevate teoreetiliste tulemustega. Lisaks vaatleme ka võimalusi anda tõenäosuslikke hinnanguid Chvatál-Sankoffi konstandile läbi Monte Carlo simulatsioonide.
Keerulise või tundmatu jaotusega hinnangutele täpsusnäitajate (nt. dispersioon või usaldusvahemik) leidmine on tihtiesinev probleem statistikas. Üks levinumaid lahendusi on bootstrap-hinnangud, mis on mõjusad üldistel tingimustel ja klassikalisel eeldusel, et valimi elemendid on sõltumatud. Valikuuringute kontekstis see sõltumatuse eeldus on täidetud vaid LJV TGA (lihtne juhuvalik tagasipanekuga) ja Poissoni disaini korral, mistõttu bootstrap-hinnangute leidmine on üldjuhul raskendatud. Lisakeerukust tekitab juurde ka mittevastamine ja sellest tekkinud nihke korrigeerimine (mudelipõhine korrektsioon ja kalibreerimismeetodid). Bakalaureusetöö eesmärk on uurida bootstrap-hinnangute leidmise võimalusi valikuuringutes. Lisaks saab bootstrap-hinnanguid võrrelda klassikaliste hinnangutega simuleeritud andmestikul.
NeoLEO kliinilise valideerimisuuringu eesmärk on hinnata, kas NeoLEO raamistiku rakendamine suurendab rinnapiimaga toitmise määra haiglast väljakirjutamisel väga madala sünnikaaluga laste seas. Enne-pärast uuringu kavandamiseks on vaja hinnata senist rinnapiimaga toitmise määra ehk baasmäära ning selle põhjal määrata valideerimisuuringuks vajalik valimi suurus. Praegu need hinnangud puuduvad. Käesolevas lõputöös analüüsitakse retrospektiivseid patsiendiandmeid, kirjeldatakse uuritavat kohorti ja andmete täielikkust ning hinnatakse rinnapiimaga toitmise baasmäära. Saadud hinnangu põhjal arvutatakse NeoLEO valideerimisuuringuks vajalik valimi suurus ning hinnatakse selle tundlikkust erinevate eelduste suhtes. Lõputöö tulemusena valmib retrospektiivse kohordi kirjeldav ülevaade, rinnapiimaga toitmise baasmäära hinnang koos usaldusvahemikuga ning soovitus valideerimisuuringu valimi suuruse kohta koos tundlikkusanalüüsiga. Tulemused annavad statistilise aluse NeoLEO kliinilise valideerimisuuringu andmekogumise kavandamiseks.
Elukestusanalüüsis kasutatakse Kaplan–Meieri meetodit sageli elulemuse võrdlemiseks erinevates rühmades. Meetodi tavapärasel rakendamisel eeldatakse, et rühma kuulumine on jälgimisaja jooksul fikseeritud. Praktikas võib uuritav tunnus aga ajas muutuda, näiteks võib inimene alustada ravi alles jälgimisperioodi jooksul. Sellisel juhul võib tavapärane Kaplan–Meieri analüüs anda eksitavaid tulemusi. Bakalaureusetöös võrreldakse Kaplan–Meieri ja Simon–Makuchi meetodit ajas muutuva ekspositsiooni korral. Meetodite erinevusi uuritakse simuleeritud andmetel ning võimalusel rakendatakse neid ka reaalsetele andmetele.
Polügeensete riskiskooride (PGS) kataloog sisaldab ligi 5000 erinevate haiguste ja tunnuste jaoks loodud riskiskoori. Sama haiguse kohta võib olla loodud mitu erinevat PGS-i, mis põhinevad erinevatel uuringutel, valimitel ja geneetilistel variantidel ning võivad seetõttu anda erinevaid tulemusi. Töö eesmärk on uurida, millised 2. tüüpi diabeedi jaoks loodud PGS-id annavad Eesti geenivaramus 2. tüüpi diabeedi diagnoosimisega tugevamaid seoseid. Seejuures uuritakse, millised PGS-ide omadused võivad seose tugevusega seotud olla. Näiteks saab analüüsida, kas tulemusi mõjutavad PGS-i aluseks oleva avastusuuringu valimi suurus või skooris kasutusel olevate geenivariantide arv. Samuti pakub huvi riskiskoori aluseks olnud metoodika ning alusuuringu päritolukooslus. Analüüs on teostatav olemasolevate koondstatistikute põhjal ning andmed on analüüsimiseks sobival kujul olemas.
Südame isheemiatõve (CAD) jaoks on loodud arvukalt erinevatel uuringutel ja geneetilistel variantidel põhinevaid polügeenseid riskiskoore. Sama haiguse erinevad PGS-id võivad Eesti geenivaramu andmetes näidata erineva tugevusega seoseid või seost üldse mitte näidata. Töö eesmärk on uurida, millised CAD-i jaoks loodud PGS-id annavad Eesti geenivaramu andmetes südame isheemiatõve diagnoosiga tugevamaid seoseid. Seejuures uuritakse, millised PGS-ide omadused võivad seose tugevusega seotud olla. Näiteks saab analüüsida, kas tulemusi mõjutavad PGS-i aluseks oleva avastusuuringu valimi suurus või skooris kasutusel olevate geenivariantide arv. Samuti pakub huvi riskiskoori aluseks olnud metoodika ning alusuuringu päritolukooslus. Analüüs on teostatav olemasolevate koondstatistikute põhjal ning andmed on analüüsimiseks sobival kujul olemas.
Eesti geenivaramu andmetel on uuritud umbes 1900 ICD-10 haiguskoodi ja 4700 polügeense riskiskoori vahelisi seoseid logistilise regressiooni abil. Analüüsid on tehtud kahel viisil: esiteks on kõiki geenidoonoreid käsitletud sõltumatute vaatlustena ning teiseks on andmestikust eemaldatud omavahel suguluses olevad indiviidid. Töö eesmärk on võrrelda nende kahe lähenemise tulemusi ning uurida, kuidas geenidoonorite suguluse arvestamine mõjutab leitud seoseid, sealhulgas p-väärtusi, šansside suhteid ja seoste statistilist olulisust. Peamine eesmärk on tulemusi atraktiivselt visualiseerida ning hinnata, kuivõrd suur ja süsteemne on suguluse mõju ning kas see kujutab endast haiguste ja PGS-ide vaheliste seoste analüüsimisel olulist metodoloogilist probleemi. Töö tegemisel võib kasuks tulla segamudelite teooriaga tutvumine. Töö põhineb juba olemasolevatel koondstatistikutel ning ei eelda individuaaltasandi andmete täiendavat analüüsi.
Uute ristamisvanemate valimisel on oluline teada nende omadusi. Üks tähtsamaid on saak ja saagi stabiilsus, mis tuleks välja selgitada suhteliselt lühikese aja jooksul, sest sordid nn vananevad ja ei ole aega teha katseid pikema perioodi jooksul. Töö eesmärgiks olekski leida erinevaid statistilisi saagistabiilsuse näitajaid, neid omavahel võrrelda ja välja valida neist parim(ad) , mis sobiks(id) hindamiseks lühikese ajavahemiku jaoks (kolm aastat). Hernesortide saagiandmed erinevatel aastatel on olemas.
Põldoa faktoriaalne põldkatse:
1. Faktorid: a) neli niiskusrežiimi: põud, optimaalne, liigniiskus, kontroll (looduslik)
2. 18 genotüüpi (sorti)
3. Kolm katseaastat
4. Kolm kordust
Eesmärk on teha statistiline analüüs erinevate faktorite (niiskusrežiim, genotüüp, aasta) mõjust ja nende koosmõjudest põldoa saagile ja proteiinisisaldusele, hinnata genotüüpide saagikuse stabiilsust, selgitada välja a) niiskusrežiimide ja genotüüpide mõju ulatus kultuuri saagikusele ja proteiinisisaldusele; b) põuatingimustele vastupidavamad ja varieeruvatest kasvutingimustest vähem mõjutatavad (stabiilsemad) genotüübid; c) saagikuse vähenemise põhjused ebasoodsates kasvutingimustes, s.t leida korrelatiivsed seosed saagikuse ja taime struktuurielementide (taime pikkus, sõlmevahede arv, kauna pikkus, kaunade arv, seemnete arv kaunas, seemnete kaal) vahel. Esitada saadud tulemused graafikute ja tabelitena teadusööks sobivas vormis.
Teema keskendub pikaajalistes sordivõrdluskatsetes kasvatatud hernesortide saagikuse analüüsile ning selle seostamisele vastavate aastate kliimaandmetega. Eesmärk on välja selgitada, kuidas erinevad ilmastikutingimused, näiteks temperatuur ja sademed on mõjutanud hernesortide saagikust ja saagistabiilsust. Analüüsi abil saab hinnata, millised sordid on olnud muutlikes kasvutingimustes vastupidavamad ning millistel varasemalt kasvatatud sortidel või aretusmaterjalidel võib olla potentsiaali praeguses ja muutuvas kliimas. Tulemused toetavad kliimakindlamate ja saagikamate hernesortide valikut ning edasist aretustööd.
i) talirukki sortide vaatlusandmed: saagikus, mahumaht, langemisarv - seos ilmastikuoludega. Materjal sisaldab tava- ja maheviljelust;
ii) lisaks on teemaplokk, kus saab võrrelda kahe katseaasta rukki andmeid erinevatel väetusfoonidel, kas ja mil määral väetamine saagikust ja kvaliteeti mõjutavad
iii) huvi korral on võimalik ka suvirukki saagiandmeid võrrelda keskkonnatingimustega. Kõik katsed kolmes korduses.
AKIS teenuse raames pakutakse igal aastal ligemale 150 erinevat teadmussiirde üritust, milles on ca 9000 osalejat (unikaalseid osalusi on ca 5000). Kombineerides teadmussiirde tegevuses osalejate andmeid ja majandustegevuse registri andmeid, on uuringu eesmärk välja selgitada, 1) kas teadmussiirde tegevustes osalejate ettevõtted on oma majandustegevuses edukamad, kui mitteosalevad ettevõtted, 2) millised on teadmussiirde tegevustes osalevat ettevõtete profiilid ja kas need erinevad mitteosalevatest ettevõtetest. Teadmussiirde tegevusi korraldatakse 6 erinevas valdkonnas, võimalik on uurida, kas valdkondade ahel on teadmussiirde osalemises süsteemseid erinevusi? Uurimisküsimused võivad jaguneda erinevate uurimisteemade vahel.
Predicting control/adenoma/colon-cancer group from blood metabolites. To fulfill the aims of this project, one needs to choose appropriate models to assess associations between blood metabolites and outcome consisting of three groups, apply it on real-life data and visualise the results.
Predicting control/adenoma/colon-cancer group from background metadata, such as alcohol consumption, smoking status, etc. To fulfill the aims of this project, one needs to choose appropriate models to assess associations between metadata and outcome consisting of three groups, apply it on real-life data and visualise the results.
Assessing the association between CRC-metabolite score and microbiome. To fulfill the project aims, one needs to calculate NMR-metabolite score for EstMB cohort using betas from a published score (https://www.nature.com/articles/s41467-024-54357-0), use appropriate model to assess the association with various microbiome outcomes, and illustrate the results using suitable figures. Optionally assess whether adjusting for BMI attenuates the results.
Mikrobioomi ja uute depressioonijuhtude vahelised seosed. Projekti käigus arvutatakse Eesti Mikrobioomi Kohordi andmestikus erinevad mikrobioomi terviseindeksid ja kasutades sobivaid statistilisi mudeleid, analüüsitakse nende omavahelisi seoseid ja seoseid indiviidi tausttunnustega. Nende ennustusvõimsust uute depressioonijuhtude suhtes testitakse sobivate statistiliste meetoditega. Paralleelselt koostatakse klassikalistel masinõppemeetoditel (nt Random Forest, elastic net) põhinevad depressiooni-spetsiifilised ennustusmudelid mikrobioomi tunnuste põhjal ning võrreldakse nende täpsust üldiste terviseindeksitega ja nende lisandväärtust klassikaliste riskitegurite (vanus, sugu, BMI jt) kõrval. Projekti eesmärk on selgitada, kas ja millisel kujul võiksid mikrobioomiandmed pakkuda kasulikku prognostilist infot depressiooniriski hindamiseks. Projekti on võimalik jagada väiksemateks alaosadeks ja saab keskenduda erinevatele terviseindeksitele ja/või masinõppe mudelitele.
Eestis on hetkel sündimus ajaloolises madalseisus ning põhjusena tuuakse sageli eluaseme kättesaadavust. Selle töö teema raames võiks vaadata, kas ja kui palju enne või pärast lapse sündi on inimesed ostnud oma eluaseme (maja, korteri) ning milliseid seaduspärasusi siin näeb. Kasutada oleks kinnistusregistri, rahvastiku statistilise registri ja statistikaameti sündide andmed ning vajadusel ka Eesti Sotsiaaluuringu andmed.
Kindlustusfirma finantsseisu saab matemaatiliselt kirjeldada kui ajas kulgevat juhuslikku protsessi X(t), mis 1) lähtub mingist algkapitalist u, 2) kasvab tänu kindlustuspreemiate laekumisele ja 3) kahaneb õnnetusjuhtumitest põhjustatud väljamaksete (kahjunõuete) tõttu. Kahjunõuded tekivad juhuslikel ajamomentidel, mida tavaliselt käsitletakse Poissoni protsessina. Sellist protsessi nimetatakse riskiprotsessiks ja kindlustusseltsile pakub suurt huvi hinnata tõenäosust, et riskiprotsess jõuab nulli ehk firma laostub. Laotumistõenäosuse arvutamine on rakendusliku tõenäosusteooria hästituntud probleem, mida on uuritud üle saja aasta.
Bakalaureusetöö raames on ette nähtud laostumistõenäosuse arvutamine lihtsamates olukordades, alustades näiteks konstantsest kahjunõuetest. Seda võib vaadelda näiteks ka loterii laostumise ülesandena, kus loteriivõidud on konstantsed (100€), piletite müügist laekub keskmiselt 350 € päevas ja iga päev makstakse keskmiselt välja 3 võitu. Kirjanduse põhjal tutvutakse vajaliku teooriaga ja liigutakse samm-sammult keerulisema olukorra suunas. Antud valdkonnas on hinnatud ka ligikaudsed meetodid, mida on lihtne rakendada ja mis samas annavad piisavalt täpse tulemuse. Kõrvuti teoreetiliste arvutustega saab riskiprotsessi simuleerida arvutil.
Bakalaureusetöö eesmärk on uurida kehamassiindeksi (KMI) muutumist eri vanuserühmades. Töös kasutatakse Eesti geenivaramu andmeid, mis sisaldavad ligikaudu 200 000 geenidoonori KMI mõõtmisi eri ajahetkedel. Mõõtmised koondatakse vanuse alusel ajavahemikesse ning KMI trajektooride peamiste muutumismustrite kirjeldamiseks kasutatakse peakomponentanalüüsi (PCA). Lisaks uuritakse regressioonanalüüsi abil PCA tulemusena saadud peakomponentide seoseid tervise- ja taustatunnustega.
Vananemisega kaasneb vältimatu tervise üldine halvenemine, kuid vananemise kiirus ja selle aluseks olevad bioloogilised mehhanismid on indiviiditi erinevad. Üks vananemisega seotud muutusi on DNA metülatsioon, mis mõjutab geenide avaldumist ilma DNA järjestust muutmata. Bioloogilise vananemise erinevate aspektide hindamiseks saab kasutada DNA metülatsioonikelli, mis on statistilised mudelid, mis põhinevad genoomi kindlate piirkondade metülatsiooniandmetel. Käesoleva bakalaureusetöö raames tutvub tudeng DNA metülatsioonikellade metoodikaga ning uurib nende seoseid kronoloogilise vanuse ja 2. tüüpi diabeedi riskiga Tartu Ülikooli Eesti geenivaramu andmete põhjal.
Tartu Ülikooli Eesti geenivaramu avas 11. juunil 2024 portaali MinuGeenivaramu, mille kaudu saavad doonorid personaalset teavet teist tüüpi diabeedi ja südame isheemiatõve eelsoodumuse, kofeiini lagundamise kiiruse, geneetilise päritolu ning kindlate ravimite sobivuse kohta. Tänaseks on portaali külastanud 129,000 geenidoonorit. Käesoleva bakalaureusetöö raames uurib tudeng, kas portaali külastamine on mõjutanud geenidoonorite ravimikasutust. Aluseks võetakse portaali külastamise kuupäeva ja hoiatuse sisu (millise ravimi suhtes) ning võrreldakse digiretsepti andmebaasist nende ravimioste, et selgitada välja, kas muudeti või katkestati ravi. Lisaks uuritakse, kas hoiatustega geenidoonoritel muutus ravi sagedamini kui hoiatusteta doonoritel.
Tartu Ülikooli Eesti geenivaramu avas 11. juunil 2024 portaali MinuGeenivaramu, mille kaudu saavad doonorid personaalset teavet teist tüüpi diabeedi ja südame isheemiatõve eelsoodumuse, kofeiini lagundamise kiiruse, geneetilise päritolu ning kindlate ravimite sobivuse kohta. Tänaseks on portaali külastanud 129,000 geenidoonorit. Käesoleva bakalaureusetöö raames uurib tudeng, kas portaali külastamine on mõjutanud geenidoonorite ravimikasutust. Aluseks võetakse portaali külastamise kuupäeva ja seal kuvatud südame isheemiatõve riski ning analüüsitakse digiretsepti andmebaasist saadud ravimioste, et selgitada välja, kas alustati ravi a) kaalu langetamiseks b) kolesterooli alandamiseks ja/või c) vererõhu langetamiseks. Lisaks uuritakse, kas ravi alustamine sõltus haiguse geneetilise- või koguriski tasemest.
Üks väga oluline ülesanne TÜ Eesti geenivaramuga seotd teadustöös on töötada välja mudelid, mida saaks kasutada personaliseeritud riskihinnangute ja sellest tulenevalt ka haiguste ennetuse juures. Huvipakkuvateks haigusteks on eelkõige tõsised kroonilised haigused nagu südame-veresoonkonnahaigused, teise tüübi diabeet, ka levinumad vähkkasvajad. Haiguse riskifaktorite mõju hindamisel kasutatakse enamasti nn poolparameetrilisi Coxi mudeleid, kuid nende mudelite kasutamine absoluutriski hindamisel on komplitseeritud. Bakalaureusetöö eesmärgiks ongi uurida ühte parameetriliste mudelite klassi (nt Weibulli mudelid ja nende paindlikud edasiarendused) ja selle potentsiaali haiguseriski prognoosimusel. Konkreetne uuritav haigus lepitakse kokku vastavalt tudengi huvile.
TÜ Eesti geenivaramu andmebaas on suurim terviseandmeid koondav kohort Eestis. Et enamus geenidoonoreid täitsid liitumisel küsimustiku oma tervise ja tervisekäitumise kohta, siis on nende andmete põhjal võimalik uurida küsimusi tervisekäitumise mõjust haiguste ja suremuse riskile. Siiski pole see nii lihtne, sest ükski riskitegur pole sõltumatu teistest – lihtne analüüs ei anna vastust küsimusele, kas haiguseriski põhjustab just uuritav tervisekäitumise näitaja või mingi muu, sellega seotud tegur. Bakalaureusetöö eesmärgiks on tutvuda ühe põhjusliku analüüsi meetodiga, mis teatud eeldustel võib aidata saada objektiivsemat vastust riskiteguri põhjusliku mõju küsimusele. Konkreetse uurimisküsimuse (kas uurime haiguse või suremuse riski ja millisele riskitegurile keskendume) lepime kokku vastavalt tudengi huvile.
Bakalaureusetöö eesmärgiks on uurida, kuidas mõjutavad eelkõige naise tervisega seotud tegurid laste saamist. Selleks kasutame vahemikus 2003-2011 liitunud naissoost geenidoonorite andmeid ja elukestusanalüüsi meetodeid. Tudeng peab tutvuma nn aeg-sündmuseni tüüpi andmete analüüsi metoodikaga ja arutleme ka selle üle, kuidas saaks mudelitesse kaasata ajas muutuvaid argumenttunnused või aega ennast.
Polygenic risk scores (PRS) combine information from many genetic variants to estimate an individual's genetic predisposition to a trait or disease. Most PRS have been developed using European-ancestry datasets and often perform less accurately in other populations. While this reduction in performance is well documented, the reasons behind it remain unclear. Using
simulations and large-scale biobank datasets, we aim to understand why PRS performance differs across populations and how prediction methods can be improved. The exact scope can be tailored to the student's interests and background. (more than one topic is possible)
Generative AI has emerged as an important tool for generating realistic synthetic genomic datasets. In this context, a major challenge remains which is the assessment of the realism of generated samples. This thesis project will investigate whether statistical two-sample tests can be used to compare real and synthetic genomic data and determine whether they could originate from the same multivariate distribution. The thesis will include identifying suitable methods for high-dimensional genotype data and comparing their statistical power and computational feasibility. Different scenarios will be considered by varying factors such as the number of features (e.g., genomic positions), sample size, allele-frequency differences, or the degree of population differentiation. The selected methods will then be applied to synthetic genomic datasets generated by different models to evaluate which approaches are most informative for assessing similarity between real and synthetic data.
Vaibla Linnujaamas (vt vaibla.net) märgistatakse igal suvel juulist septembrini rändel olevaid väikseid värvulisi (pääsukesi, tihaseid, lehelinde, roolinde jt). Märgistamisega koos mõõdetakse lindudel tiivapikkus ja kehamass. Andmed talletatakse andmebaasis ning need on kättesaadavad Google Sheets kaudu. Mõned linnud satuvad võrkudesse korduvalt (enamasti mõne päeva jooksul), need mõõdetakse ja kaalutakse korduspüügil uuesti.
Aastas rõngastatakse 15..20 tuhat lindu ~100 liigist. Jaotus ebaühtlane, tippliike paarkümmend. Vt tabel.vaibla.net jooksva aasta andmeid või koond.vaibla.net kõigi aastate andmeid.
Sama aasta korduspüüke aastas u 1000. Erinevaid rõngastajaid 50 aga neid, kes on rõngastanud paarsada lindu või rohkem on ~20.
Andmeväljad, mis talletatakse
Mõõtjate kohta on teada taustaandmeid:
Aruteludeks Kristjan Adojaan - [email protected]; [email protected] või Vaibla Linnujaama üldaadressil [email protected]
Eeldus on, et õhtul rõngastatud linnud on raskemad, ööbides kulub veidi energiat (või siis päeva jooksul söödud toit seeditakse, talletatakse rasvana ja jäägid ekskrementeeritakse).
Sarnasel teemal on tehtud 3. kl õpilasuurimus, huvitav oleks põhjalikumate meetoditega uurida.
Kui kehamass võib muutuda seoses sellega, et lind valmistub rändeks (toitub intensiivselt ja kogub rasva), või vastupidi, otsib toitu, kuid ei leia ja kaotab kaalu, mis on normaalne muutus siis tiiva pikkus üldjuhul nii väikse ajavahemiku järel ei tohiks oluliselt muutuda - tiivad enam ei kasva. Küll aga oleme andmetes märganud rõngastamise ja korduspüügi vahel mõõdetud tiivapikkuse erinevust, mis tuleneb eeldatavasti mõõtjast. Uurimisteemaks olekski mõõtmistäpsusega seonduv. Sarnasel teemal on varasemalt tehtud üks bakalaureusetöö. Toona püstitatud küsimusi võib edasi arendada: valminud töö keskendus suitsupääsukesele (keda mõõdetakse palju aga korduspüüke on vähe), lisaks võiks vaadelda nt roolinde (keda mõõdetakse ka üsna palju, ning on ka kordusi, sh mitu eri liiki: kõrkja-, tiigi-, soo-, aed-roolind).
Uurimisküsimused korduspüükide põhjal
Uurimisküsimused ilma korduspüükideta
Mõnedel liikidel (suitsupääsuke) mõõdetakse väga palju isendeid aga korduspüüke on minimaalselt. Samas võib eeldada, et kõik lähedasel perioodil (nt samal päeval) püütud sama vanusega (vanuse kategooriaid on 2: noor- ja vanalinnud ehk samal või varasemal aastal koorunud) isendid võiksid olla sarnase tiivapikkusega (st normaaljaotuskõver võiks olla sama), sest rõngastajad võtavad neid töösse juhuslikult.
Arvestama peaks muid mõõtmis- või sisestusvigu, mis ei pruugi tuleneda mõõtmise ebatäpsusest vaid nt et on valesti sisestatud, ehk peaks eriti suuri erinevusi, kui need on juhuslikud, püüdma analüüsist kõrvale jätta. Võimalikud suuremad erinevused võivad tuleneda veel linnu sulgimisest (nt kui kõik suled pole veel täispikkust saavutanud).
Viimase numbri nihe
Empiiriliselt tundub, et mõnda millimeetrit kipuvad mõõtjad vältima. Nt kui normaaljaotuse järgi peaks olema 120, 121, 122 ja 123 üsna võrdselt (täpse jaotuse saaks kogumi järgi ilmselt välja arvutada), siis näiteks 122 sisestatakse palju vähem kui 121 v 123. Võiks liigipõhiselt uurida selliseid anomaaliaid ja nende seost isikutega.
Linnud peatuvad toitumiseks. Rändepeatus võib olla olematu - pääsukesed lendavad järgmisel päeval edasi või võib ulatuda mitme nädalani. Rändepeatuse ajal on linnud kohapeal ja toituvad (= söövad end rasva). Väikestel lindudel võib kehakaal suureneda kuni 50%, nt tavaliselt 11-grammine lind võib rasvavaruga olla 16 grammi. Rändepeatuse pikkust saab uurida samas kohas samal aastal uuesti püütud lindude korduva kaalumise andmetest. Neid andmeid on ~viimastest 5 aastast. Rändepeatuse pikkus (ilma kaalumata, lihtsalt kohaloleku aeg) andmed on pikemast ajast (aga vajavad veidi korrastamist). Saaks uurida
Lisainfo: Andres Kiviste, [email protected]; Allar Padari, [email protected]; Ahto Kangur, [email protected]
Eestis on kasutusel puistu kasvu prognoosimiseks puistuelemendi tasemel kasutatavad kasvumudelid. Lõputöö käigus analüüsitakse seni loodud Eesti ja naabermaade mudeleid ja töötatakse välja Eesti tingimustesse sobivad üksiku puu kasvul põhinevad kasvumudelid. Töö jaoks on kasutada eesti metsanduslikelt pikaajalistelt proovialadelt aja jooksul kogutud välimõõtmiste andmeid, kuid vajadusel ka täiendavate välimõõtmiste käigus kogutud andmeid. Lähtuvalt üliõpilase huvist, praktilisest vajadusest ja olemasolevatest mõõtmisandmetest valitakse modelleerimiseks sobiv takseertunnuste vaheline sõltuvus.
Eestis on kasutusel puistu kasvu prognoosimiseks puistuelemendi tasemel kasutatavad kasvumudelid. Lõputöö käigus analüüsitakse seni loodud Eesti ja naabermaade mudeleid ning töötatakse välja Eesti tingimustesse sobivad üksiku puu kasvul põhinevad kasvumudelid, mis arvestavad ka puistu tasemel takseertunnustega. Töö jaoks on kasutada eesti metsanduslikelt pikaajalistelt proovialadelt aja jooksul kogutud välimõõtmiste andmeid, kuid vajadusel ka täiendavate välimõõtmiste käigus kogutud andmeid. Lähtuvalt üliõpilase huvist, praktilisest vajadusest ja olemasolevatest mõõtmisandmetest valitakse modelleerimiseks sobiv takseertunnuste vaheline sõltuvus.
Eestis ei ole praktikas kasutatavat mudelit üksikpuu juurdekasvu prognoosimiseks uute puude lisandumisel. Lõputöö käigus analüüsitakse seni maailmas kasutusel olevaid mudeleid ning töötatakse välja Eesti tingimustesse sobivad juurdekasvu mudelid, mis arvestavad uue puistuosa lisandumist. Töö jaoks on kasutada eesti metsanduslikelt pikaajalistelt proovialadelt aja jooksul kogutud välimõõtmiste andmeid, kuid vajadusel ka täiendavate välimõõtmiste käigus kogutud andmeid. Lähtuvalt üliõpilase huvist, praktilisest vajadusest ja olemasolevatest mõõtmisandmetest valitakse modelleerimiseks sobiv takseertunnuste vaheline sõltuvus.
Aasta 2020 seisuga on Eesti taimede levikuatlases umbes 540 taimeatlase ruudu (9x11 km, koordinaatidega määratud, seetõttu pole ruudud) kohta enam kui miljon kirjet. Analüüse, mida nende andmetega teha võiks, on palju. Aga esimese küsimusena huvitaks asja inimlik külg – so taimede uurija ja atlasesse sissekannete tegija. Kuidas jaotuvad uurijad sissekannete arvu alusel, kas ilmneb mingeid taimeliikide-põhiseid mustreid – kas erinevad uurijad on tähele pannud erinevaid liike? Jmt.
See, kui palju lehm ööpäevas piima annab, sõltub nii söötmis-pidamistingimustest, looma geneetilisest potentsiaalist ja ka vanusest. Samuti muutub piimakogus küllaltki palju laktatsiooni jooksul, tõustes järsult peale poegimist, saavutades maksimumi 2.-3. laktatsioonikuul ja hakates seejärel tasapisi langema. Eesti Põllumajandusloomade Jõudluskontrolli AS-i andmebaasis on talletatud peaaegu kõigi (~98%) Eesti piimalehmade igakuised kontroll-lüpsitulemused. Nende andmete alusel on võimalik viia läbi mitmeid uuringuid. Näiteks:
*) lehmade piimatoodangu ning piima kvaliteedinäitajate laktatsioonisisese dünaamika hindamine erinevate mittelineaarsete regressioonimudelitega;
*) lehmade piimatoodangu laktatsioonisisese dünaamika hindamine splainidega ning splainide optimaalse järgu ja katkestuspunktide hindamine;
*) taimekasvatuses kasutatud sortide nö stabiilsusindeksite (vt Joonas-Sander Tamme magistritööd aastast 2024) rakendamine piimatoodangu stabiilsuse hindamisel.
Kõik teemad eeldavad esmalt vastava metoodika lahtikirjutamist ja seejärel rakendamist Eesti piimaveiste andmetel. (Näitena toodud teemasid võib omavahel kombineerida.
Kuus aastat tagasi valiti Eesti Tõuloomakasvatajate Ühistu poolt juhuslikul välja 2265 eesti holsteini tõugu ja 215 eesti punast tõugu mullikat, kes genotüpiseeriti keskmise tihedusega geenikiibiga (~50000 SNP-d). Nende andmete alusel on võimalik läbi viia mitmed loomakasvatajatele ka sisuliselt huvipakkuvaid uuringuid. Näiteks võib töö teemaks olla
*) geneetikas palju kasutatav admixture-algoritm ja selle rakendamine Eesti piimaveiste andmetel – küsimus on, kas ja kui mitmesse klastrisse erinevat tõugu mullikad klasterduvad ning kas ja kuivõrd peegeldavad moodustunud klastrid mullikate isade päritolu (esindatud on 10 erinevat riiki);
*) genotüpiseerimistiheduse ja genotüpiseeritud loomade arvu mõju populatsiooni geneetilise struktuuri hindamise täpsusele – nimelt ei ole Eestis erinevalt paljudest teistest riikidest rahalist ressurssi genotüpiseerida kõiki loomi ja seetõttu on oluline mõista, kui palju, milliseid ja kui tiheda kiibiga oleks vaja genotüpiseerida, et saada piisavalt infot kogu populatsiooni kohta, töö eeldab rohkete simulatsioonide läbi viimist. (Maaülikoolist saadetud uurimisküsimused: kuidas mõjutab SNP-markerite arv genoomse suguluse ja inbriidingu hinnanguid; kuidas muutub hinnangute varieeruvus valimi suuruse kasvades; millise valimi suuruse juures muutuvad populatsiooni keskmised hinnangud piisavalt stabiilseks; kas keskmise tihedusega SNP-paneel annab suure tihedusega paneeliga võrreldavad tulemused; milline inbriidingu hindamise meetod on markeritiheduse ja valimi suuruse suhtes kõige robustsem?)
*) sugupuu- ja genotüübiandmetel baseeruv sugulus- ja inbriidingukoefitsientide hindamise metoodika ning nende võrdlev rakendamine Eesti piimaveiste andmetele.
Maaülikooli doktorant Egle Liiskmann on juba neli aastat (2023-2026) kogunud andmeid erinevate putukate esinemise kohta Maaülikooli haljasaladel. Ja nüüd on soov neist andmetest midagi välja lugeda – huvi pakub nii ajaline dünaamika kui ka alade vaheline erinevus, samuti üldisemad kooslusemustrid. Analüüsimeetoditena tuleks ilmselt rakendada nii klassikalisi mudeleid ja teste kui ka mõningaid mitmemõõtmelise statistika meetodeid.
Kõrvuti ajakirjanduses üksjagu kajastust leidnud eduka hobuste kloonimise projektiga tegeletakse Maaülikoolis ka mitmete teiste reproduktiivmeditsiini-alaste projektidega. Neist üks värskemaid on seotud veiseembrüote eluvõime ennustamisega. Praegu hinnatakse embrüote kvaliteeti suuresti nende välimuse põhjal, kuid ka visuaalselt väga hea kvaliteediga embrüo ei pruugi pärast siirdamist anda tiinust. Eesmärk on leida embrüo arengust mõõdetavaid mustreid, mis võimaldaksid tema edasist eluvõimet täpsemalt prognoosida. Selleks toodetakse laboris veiseembrüoid ning jälgitakse nende arengut time-lapse imaging (TLI) süsteemiga. Iga embrüo kohta tekib ajas järjestatud pildiseeria ning hulk morfokineetilisi tunnuseid, näiteks esimeste rakujagunemiste ajad, rakutsüklite pikkused, jagunemiste sünkroonsus, kompakteerumine ja blastotsüsti moodustumine. Lisaks registreeritakse embrüote külmutamise ja sulatamise tulemused, sealhulgas ellujäämine ja re-ekspansioon, ning osade embrüotega saab hiljem siduda ka embrüosiirdamise ja tiinuse tulemused. Seega tekib haruldane andmestik, kus ühe embrüo varajase arengu ajalugu on seotud tema tegeliku bioloogilise lõpptulemusega. Andmete kogumine jätkub, aga üksjagu andmeid on juba olemas ning seetõttu on paras aeg hakata mõtlema ja katsetama, milliste analüüsimeetodite abil ja kui edukalt on võimalik soovitud tulemuseni jõuda – bakalaureusetöös saaks rakendada ja võrrelda mõningaid masinõppe algoritme-mudeleid.
Tegu on reaalsete andmete analüüsiga. Kahte jõkke asustati kahest populatsioonist pärit noorkalad ning edasi seirati neid 1,5 kuu jooksul igapäevaselt – loeti üle, mõõdeti, võeti DNA-proov jm.
Aastail 2019-2021 viidi läbi uuring, mille käigus koguti viiest kasvandusest andmeid vikerforellide neeruhaiguse kohta. Uuringu raames lahati noorkalu, mõõdeti neeru paistetust ning neeru ja lihaskoe vahelist suhet jm haigustunnuseid. Lisaks on olemas andmed veetemperatuuri andmed (haigust põhjustava parasiidi aktiivsus sõltub oletatavasti vee temperatuurist).
Maaülikooli mullateaduse õppetoolis viiakse hetkel läbi katset, mille käigus kasvatakse ühte mudeltaime terve kasvuperioodi vältel labori tingimustes, et leida seoseid mulla omaduste ja taime kasvu (biomassi saagi) ja keemilise koostise vahel ning uurida, kuivõrd on tulemused kooskõlas kehtivate väetussoovitustega.
Valitud on lühikese kasvuajaga taim, mis vajab kasvamiseks suhteliselt väikest mulla (substraadi) kogust. Katses kasutatakse erineva päritolu ja seega erinevate keemiliste ja füüsikaliste omadustega muldi. Algmullad on happelised, väetamisega on need neutraliseeritud. Erinevate muldade arv viis, kasutatud väetiste arv neli ja paralleelkatsete arv on neli.
Katse käigus mõõdetakse kord nädalas lehe roseti diameetrit, klorofülli sisaldust ja taime kõrgust. Katse lõpus määratakse taime kogu biomass, juurte kogupikkus ja mass, maapealse osa mass. Mulla üldanalüüs hõlmab fraktsioonilise koostise (savi, tolmu ja liiva sisaldus), orgaanilise (Corg) ja mineraalse (Cmin) süsinku ja orgaanilise lämmastiku (Norg) määramise tulemusi. Katse lõpus määratakse mullast pH, taimetoitelelementide sisaldused Mehlich3 ja AL meetoditel (P, K, Ca, Mg) ning veega ekstraktsioonil (P, K, Ca, Mg, NO3+, NH4+).
Soovitakse teada, millised elementide sisaldused on optimaalsed taimede kasvuks ja kas need vastavad kasutatud agrokeemiliste meetodite (AL ja Mehlich 3) gradatsioonidele. Kas olulisemad on elementide üksikud sisaldused või nende kombinatsioonid?
Polli aiandusuuringute keskusest on pärit mitme aasta andmed musta sõstra erineva genotüübiga (põhimõtteliselt erinevat sorti) taimede esialgse õite ja hilisema järelejäänud viljade arvu kohta kobaras. Lisaks on andmed õitsemisaegse õhutemperatuuri kohta. Vaja oleks uurida eri genotüüpide õite ja viljahakatiste varisemise protsenti ning selle sõltuvust õitsemisaegsest temperatuurist (öökülmast).
Kuuel Natura 2000 alade hulka kuuluval rannaniidul on igal ühel on 80–110 1 m² prooviruutu. Nende prooviruutude kohta on registreeritud-määratud 3 cm täpsusega koordinaadid, kõrgus, mulla niiskus, taimestiku kõrgus, niidetud biomassi kaal ja taimeliikide koosseis protsentides, samuti kvalitatiivne info selle kohta, millisesse taimekooslusse konkreetne prooviruut kuulub (igal rannaniidul leidub neli peamist ja üks või kaks täiendavat taimkattekooslust, neljas koosluses esineb liike, mis on vastava elupaiga kaitse alla võtmise aluseks olevateks indikaatorliikideks, ülejäänud kahes domineerivad kiiresti levivad liigid, nagu harilik pilliroog).
Samuti on kõigi prooviruutude kohta olemas laboratoorsed analüüsiandmed mulla ja taimestiku biomassi mikro- ja makrotoitainete sisaldusest. Kokku on samade prooviruutude kohta kolm tabelit: taimekoosluse koosseis (liigid), mulla toitaineandmed ja taimestiku toitaineandmed. Huvi pakub, milliseid toitaineid muld sisaldab ja milliseid toitaineid taimed omastavad, muutes need kättesaadavaks rannaniidu toiduvõrgustikule (st putukatele, rändlindudele ning kariloomadele).
Kõigi 63. teema juures kirjeldatud rannaniitude kohta on olemas ka droonidega kogutud RGB-andmestik (punase, rohelise ja sinise kanali indekskaardid, digitaalne pinnamudeli (DSM) ja digitaalne maastikumudeli (DTM) kaart) ning eraldi multispektraalse seire andmestik (kanalid RED, GREEN, NIR ja Red-edge). Nii RGB- kui ka multispektraalsete andmete põhjal saab arvutada 20–30 erinevat taimkatteindeksit. Need indeksid näevad välja nagu kaardid, kuid nende pikslitel on 3 cm täpsusega koordinaadid ja määratud matemaatilised väärtused (sarnaselt DTM-kaartide pikslitele). Eesmärgiks on hinnata RGB- ja multispektraalsete drooniandmete ning prooviruutude kohta teadaoleva info alusel taimkattekoosluste leviku kaardid, mida edasi kasutada toitaineandmete kvantifitseerimiseks kogu uurimisalal. Andmete kogumise metoodika on publitseeritud: https://dx.doi.org/10.3791/70523
Ennemuistsel ajal kasutati korrelatsioonikordajaid, mis mõõtsid kas lineaarse seose tugevust (Pearsoni korrelatsioonikordaja) või monotoonse seose tugevust (Spearmani korrelatsioonikordaja). Tänapäeval kasutatakse üha enam seosekordajaid, mis tuvastavad mistahes seose olemasolu tunnuste vahel. Näiteks xi korrelatsioonikordajat, MIC jt. Samas pole nende kordajate omadused statistikute seas eriti tuntud. Töös tuleks tutvustada neid kordajaid ja katsetada nende usaldusväärsust ja töökindlust päris- ja simuleeritud andmestikke kasutades.
Genoomiuuringutes on vahel tarvis kirjeldada seda, kas uuritavat tunnust mõjutavad paljud geneetilised variandid või vähesed, kas need mõjud on suured või pigem väikesed või üliväikesed. Ühesõnaga - oleks tarvis kirjeldada tegelike mõjude jaotust. Tegelike mõjude jaotusest võib abi olla nii hilisemas analüüsis - seda saab kasutada näiteks eeljaotusena, mis võimaldab geenimutatsioonide mõjusid hiljem täpsemalt hinnata; kuid tal võib ka olla otsene interpretatsioonile väärtus geneetikutele. Naiivselt võiks arvata, et hindame mutatsioonide mõjud (näiteks ülegenoomset assotsiatsiooniuuringut kasutades) ja saadud hinnangute põhjal hindamegi tegelike mõjude jaotust. See variant pole aga enamasti parim lähenemine, sest hinnangud on mõjutatud ka hindamisvigade poolt ja sestap on näiteks hinnangute dispersioon märksa suurem kui tegelike mõjude dispersioon. Bakalaureusetöö raames tuleks uurida ja võrrelda paari meetodit, mis on mõeldud tegelike mõjude jaotuse hindamiseks. Vaja oleks meetodite tööpõhimõttest arusaamine, seejärel tuleks meetodit kasutada nii pärisandmestike kui ka simuleeritud näidisandmestike analüüsiks.
Võimalik kuni 2 teemat.
Mis saab siis, kui andmed pärinevad tegelikult mitmest erinevast jaotusest, kuid me ei tea, milline vaatlus millisesse alampopulatsiooni kuulub? Selliste andmete modelleerimiseks kasutatakse sageli normaaljaotuste segusid. Normaaljaotuste segudel on oluline roll näiteks mudelipõhises klasteranalüüsis, varjatud Markovi mudelites ning teistes latentsete tunnustega mudelites.
Segu komponentide parameetrite hindamine ei ole aga alati lihtne. Tavaliselt kasutatakse selleks suurima tõepära meetodit koos EM-algoritmiga, kuid normaaljaotuste segude korral on tõepärafunktsioon ülalt tõkestamata ning tugevalt kattuvate komponentide korral võib parameetrite hindamine olla keeruline.
Bakalaureusetöö keskmes on pseudo-tõepära meetod (Kangro, Kuljus ja Lember, 2025), mille korral kasutatav kriteeriumifunktsioon on ülalt tõkestatud ning mis on mitmetes suure komponentide arvuga mudelites andnud simulatsioonides suurima tõepära meetodist paremaid tulemusi. Töö eesmärk on uurida, millal on pseudo-tõepära meetodil eeliseid ja millal tasub eelistada mõnda teist hindamismeetodit. Selleks võrreldakse pseudo-tõepära meetodit paari teise meetodiga, näiteks suurima tõepära, suurimate vahemike või minimaalse kauguse meetodiga.
Töös tutvutakse erinevate statistiliste hindamismeetoditega ning uuritakse ja võrreldakse nende omadusi simulatsiooniuuringu abil R-is. Meetodeid rakendatakse ja võrreldakse ka reaalandmetel. Simulatsioonides saab süstemaatiliselt muuta näiteks komponentide kattuvust ja osakaale, komponentide arvu ning valimimahtu ja uurida, kuidas need mõjutavad erinevate meetodite täpsust ja stabiilsust. Mõned töös kasutatavad meetodid on R-is juba realiseeritud.
Tööd võib teha nii individuaalselt kui ka paaristööna. Paaristöö korral saab võrdlusse kaasata rohkem hindamismeetodeid ja simulatsioonistsenaariume. Eelteadmised segujaotustest ja nende hindamismeetoditest ei ole vajalikud, vajalik teoreetiline taust omandatakse töö käigus.
Kangro, R., Kuljus, K., Lember, J. (2025). Pseudo-likelihood approach for parameter estimation in univariate normal mixture models. Statistical Papers, 66(22).
Erinevates katsetes või biopankade analüüsides on võimalik leida seoseid stressorite (kemikaalid, suitsetamine) ja molekulaarsete mõõtmiste vahel. Nende analüüside tulemusi tõlgendatakse tihti rikastatuse meetodite abil erinevate bioloogiliste radade või haiguste suhtes, kasutades näiteks hüpergeomeetrilist testi.
Bakalaureusetöös kasutab tudeng nii laialdaselt kasutatavaid ülerikastatuse (enrichment analysis) meetodeid kui keerulisemaid p-väärtuse alusel järjestatud metaboliite või bioloogiliste võrgustike struktuuri arvestavaid meetodeid.
Geenivaramu andmestikus on arvutatud seosed kemikaalide või keskkonnategurite (näiteks PFOSi või peenosakeste) ja inimese metaboliitide vahel. Samuti on kasutada andmestik metaboliitide ja haiguste seostega nii Eesti geenivaramust kui ka Ühendkuningriigi Biopangast. Tudengi ülesanne on kirjeldada alternatiivseid rikastatuse meetodeid metaboloomika andmestike jaoks ning need implementeerida.
Töö tulemusi on võimalik tõlgendada avalike andmete abil. Töö tulemused panustavad erinevate keskkonnategurite ning tervise vaheliste seoste paremasse mõistmisse.
Keskkonnategurite ja tervisenäitajate seoseid on analüüsitud nii Eestis kui ka rahvusvahelistes kohortides (näiteks, https://pubmed.ncbi.nlm.nih.gov/40672052/). Lisaks seoseanalüüsidele on oluline hinnata ka keskkonnategurite põhjuslikku mõju tervisele. Varasemates uuringutes on Eesti geenivaramu andmestikus uuritud keskkonnategurite põhjuslikku mõju haigustele, kasutades ainult geenidoonorite liitumishetke keskkonnaandmeid. Kuna Eesti geenivaramus on olemas ajas muutuvad keskkonnaandmed ning kordusmõõtmised näiteks kehamassiindeksi ja vererõhu kohta, uuritakse käesolevas töös, kuidas ajas muutuvaid tunnuseid põhjusliku mõju hindamisel arvesse võtta, kasutades g-hinnangu meetodit.
Töö motivatsiooniks on fluorestsentsmikroskoopia eksperimendid, mida kasutatakse keemias molekulide seondumise omaduste uurimiseks. Töö on osa suuremast projektist, mille eesmärk on välja töötada uusi statistilisi meetodeid fluorestsentsmikroskoopia eksperimentide andmete analüüsimiseks.
Fluorestsentsmikroskoopia eksperimendis saadakse kaamerapilte kindlate määratud ajavahemike järel, kuid uuritav füüsikaline protsess toimub pidevas ajas. Seega tuleb modelleerida diskreetse ajaga vaatluste protsessi, mille aluseks on tegelikkuses pideva ajaga protsess. Kui vaatlused on antud varjatud oleku korral Poissoni jaotusega, sobib sellise protsessi kirjeldamiseks Markovi ahelaga moduleeritud Poissoni protsess (Markov modulated Poisson process). Fluorestsentsmikroskoopia andmete puhul võib aga täheldada, et sobivam jaotus andmete kirjeldamiseks võib olla negatiivne binoomjaotus.
Töö eesmärk on uurida, kuidas käituvad fluorestsentsmikroskoopia andmete modelleerimisel klassikalised varjatud Markovi mudelid ning üldisema sõltuvusstruktuuriga paariviisilised Markovi mudelid (pairwise Markov models). Vaadeldakse mudeleid, kus vaatlused on tinglikult kas Poissoni või negatiivse binoomjaotusega. Põhiküsimus on, millistes olukordades annab üks modelleerimisviis teise ees eelise, seda eelkõige parameetrite hinnangute täpsuse ja mudeli sobivuse seisukohalt. Simulatsiooniuuringutes on näiteks oluline uurida, kuidas mõjutab vaatlustevahelise ajaintervalli pikkus eri meetoditega saadud parameetrite hinnanguid.
Bakalaureusetöö sisaldab tutvumist varjatud Markovi mudelite ja nendest üldisema sõltuvusstruktuuriga paariviisiliste Markovi mudelitega. Oluline osa töös on simulatsioonieksperimentidel R-is. Meetodeid rakendatakse ka tegelikele fluorestsentsmikroskoopia andmetele. Paljud tööks vajalikud R-i funktsioonid on juba realiseeritud.
E-väärtustel põhinev (evidence based) hüpoteeside testimise teooria on suhteliselt uus statistika valdkond. Bakalaureusetöö eesmärk on valdkonda tundma õppida, lähtudes selgetest uurimisküsimustest ning olemasolevast kirjandusest.
Töö võiks keskenduda kahele küsimusele:
Töö tulemuseks oleks sissejuhatav ülevaade valdkonnast koos näidete ja simulatsiooniuuringuga, milles võrreldakse tavapärast p-väärtustel põhinevat testimist ja e-väärtustel põhinevat järjestikust testimist. Rõhk on mõistmisel ja rakendamisel, mitte uue statistilise teooria väljatöötamisel.
Quantiles, such as the median, are important characteristics of a distribution and are particularly useful for skewed data or data containing extreme observations. Confidence intervals for quantiles can be constructed nonparametrically using order statistics and the binomial distribution, without assuming a particular underlying distribution.
Empirical likelihood provides an alternative approach to nonparametric inference. It combines likelihood-based ideas with minimal distributional assumptions and allows confidence intervals to be constructed using likelihood-ratio-type statistics and their asymptotic distributions.
The aim of this project is to study empirical likelihood inference for population quantiles, with particular emphasis on the median, and to compare it with classical nonparametric confidence intervals based on order statistics. The project will include theoretical derivations, implementation in R, and a simulation study investigating the finite-sample properties of the methods. This project is suitable for a student who is interested to develop the thesis in English. The methods studied in the project provide a foundation for more advanced empirical likelihood methods for censored data and survival analysis.
The project will consider questions such as:
1. How can empirical likelihood be used to construct confidence intervals for a population quantile?
2. What is the relationship between empirical likelihood inference and classical order-statistic-based inference for quantiles?
3. How do empirical likelihood and classical confidence intervals compare in terms of coverage probability and interval length, and how do the results depend on sample size and on the quantile being estimated?
Main EL reference:
Owen, A. B. (2001). Empirical Likelihood. Chapman & Hall/CRC, Section 3.6: EL for quantiles.
Freely accessible supplementary material:
Chen, J. (2008). Applications of Empirical Likelihood, Chapter 2: Quantile Estimation. https://openscholar.uga.edu/record/12193?ln=en&v=pdf
Õpilaste matemaatikatulemused on seotud nende sotsiaalmajandusliku ja demograafilise taustaga, kuid sarnase taustaga õpilaste tulemused võivad oluliselt erineda. Töö eesmärk on uurida, millised tegurid iseloomustavad õpilasi, kes saavutavad oma tausta arvestades oodatust parema või halvema PISA matemaatikatulemuse. Esmalt modelleeritakse taustatunnuste, näiteks soo, sotsiaalmajandusliku tausta (ESCS) ja koduse tausta põhjal iga õpilase eeldatav matemaatikatulemus. Tegeliku ja eeldatava tulemuse erinevust käsitletakse positiivse või negatiivse diskordantsusena. Seejärel uuritakse, kas diskordantsusega on seotud näiteks püsivus, enesejuhtimine, juurdekasuuskumus, kooli kuuluvustunne ning digitaalne käitumine ja AI kasutamine. Kuna õpilased paiknevad koolides, saab mitmetasandiliste mudelite abil hinnata ka koolidevahelisi erinevusi. Analüüsis arvestatakse PISA 2025 prognoositud väärtuste ja valimidisainiga.
Töö eesmärk on kirjeldada Eesti reaaleluandmete põhjal patsientide tervise- ja sotsiaalmajanduslikku teekonda enne ja pärast esmast vaadeldavat ägedat müokardiinfarkti (MI). Uuring põhineb pseudonüümitud riiklike registrite andmetel, ühendades muu hulgas Tervisekassa raviarvete, retseptide ja töövõimetuslehtede andmed, Müokardiinfarktiregistri kliinilised andmed, surma põhjuste registri andmed ning Statistikaameti andmed. Töö käigus uuritakse, millised kardiovaskulaarsed ja metaboolsed riskitegurid, kaasuvad haigused, ravimid ja tervishoiuteenuste kasutamise mustrid eelnevad MI-le ning kui kaua enne sündmust on need registriandmetes tuvastatavad. Samuti kirjeldatakse MI-järgseid tulemeid, näiteks korduvaid kardiovaskulaarseid sündmusi, hospitaliseerimisi, tervishoiuteenuste kasutamist, suremust ja töövõime muutusi. Võimalusel võrreldakse MI patsientide trajektoore sobitatud kontrollrühma vastavate näitajatega. Analüüsis kasutatakse kirjeldavat statistikat, rühmade võrdlemise meetodeid ning Markovi mudeleid. Töö tulemused aitavad paremini mõista, kuidas muutuvad patsientide tervis, tervishoiuteenuste kasutamine ja töövõime MI-le eelnevatel ja järgnevatel aastatel. Analüüsi tulemusi kasutatakse laiemas INSIGHT projektis Eesti reaaleluandmetel põhinevate tervise- ja majandusmõju mudelite arendamisel.
Töös plaanitakse uurida 2021.a. välja pakutud EPO (Enhanced Portfolio Optimization) meetodit varade portfelli moodustamiseks. Klassikalise Markowitzi portfelliteooria korral saadakse tihti ebarealistlik portfell, mis reaalses turuolukorras ei tööta hästi ning seetõttu investorid praktikas seda ei kasuta. EPO meetodi korral modifitseeritakse portfelli moodustamiseks vajalikke sisendeid (oodatav tootlus ja tootluste kovariatsioonimaatriks) ning saavutatakse seeläbi Markowitzi portfelliga võrreldes paremaid tulemusi. Töös on kavas kirjeldada EPO meetodit ning empiiriliste andmete baasil võrrelda Markowitzi ja EPO meetoditega moodustatud portfelle.
Krooniline neeruhaigus on tõsine terviserike, kus kahjustunud neerud ei suuda enam oma tööd korralikult teha. CKD all kannatab hinnanguliselt 13% maailma rahvastikus ja see haigus toob endaga kaasa tõsiseid komplikatsioone ja enneaegset suremust. Haigusel on mitu teadaolevat alamtüüpi, mis on seotud erineva pikaajalise prognoosiga. Et ka alamtüüpide sees on näha väga suurt patsientide heterogeensust, pakub huvi bioloogiliselt tõlgendatavate alamtüüpide leidmine mitmemõõtmeliste andmebaaside põhjal (nt metaboloomika andmed, kombineerituna muude näitajatega). Bakalaureusetöö eesmärgiks on võrrelda erinevaid klasteranalüüsi meetodeid TÜ Eesti Geenivaramu enam kui 1400 CKD diagnoosiga indiviidi andmetel.
Olen ise spetsialiseerunud funktsionaalanalüüsi teemade uurimisele, kuid matemaatiline innovatsioon sünnib tihti mitme eri matemaatika valdkonna ühendamisel. Kuna ka minu enda huvi on laiemalt matemaatika vastu, siis olen huvitatud juhendama erinevaid lõputöid, mis on seotud nii funktsionaalanalüüsiga kui ka mõne teise matemaatika valdkonnaga. Huvi korral kirjuta või astu läbi kabinetist 4088. Täpsem teema sõltub tudengi enda huvist, ambitsioonist ja eelnevatest teadmistest.
E-kiri: [email protected]
1.1. Ennastjuhtiv õppija (millised materjalid/tööjuhendid toetaksid õppija arenemist ennast juhtivaks - erinevad kooliastmed), juhendaja Kerli Orav-Puurand
1.2. Kas õpikuülesanded toetavad põhikooli lõpueksamil vajalike matemaatikapädevuse alampädevuste arendamist, juhendajad Eva Saul, Kerli Orav-Puurand
1.3. Põhikooli valitud klassi (ja valitud teema) tekstülesannete kohandamine selliseks, et iga ülesanne toetaks matemaatikapädevuse võimalikult mitmekülgset arengut, juhendajad Eva Saul, Kerli Orav-Puurand.
Töös uuritakse, kas ja kuidas on generatiivse tehisintellekti kasutamine muutnud matemaatikaõpetajate õppematerjalide valikut ja kohandamist ning millist rolli mängib AI teiste materjaliallikate kõrval.
Sisuline idee: Uurida, kuidas 8. klassi õpilased saavad aru EISis olemasoleva matemaatika lähtetasemetesti sõnalisest tagasisidest. Töö ei eelda uue testi koostamist: lähteandmeteks on õpilaste tegelikud testitulemused ning neile EISis kuvatav teema- ja tasemepõhine tagasiside.
Võimalik pealkiri
8. klassi õpilaste arusaamine EISi matemaatika lähtetasemetesti sõnalisest tagasisidest ning tagasiside avamist toetava tugimaterjali arendamine
Uurimisprobleem
Sõnaline tagasiside näitab õpilase taset teema kaupa, kuid õpilane ei pruugi selle põhjal ära tunda oma konkreetset tugevust, parendamist vajavaid kohtasid ega järgmist õpisammu.
Eesmärk
Selgitada välja, kuidas õpilased tagasisidet tõlgendavad, ning koostada ja katsetada lühike tugimaterjal, et koos õpetajaga EISi tagasiside läbi töötada.
Praktiline väljund
Õpilase tagasiside analüüsileht ja õpetaja juhis vestluse või ühe matemaatikatunni läbiviimiseks, kus analüüsitakse testi sõnalist tagasisidet.
* Tärniga lõppevad teemad pole enam saadaval (seisuga 05.10.26 kell 14.00).
The following topics can be done in English: