• Wij

Validatie van een dataminingmodel ten opzichte van traditionele methoden voor het schatten van de tandleeftijd bij Koreaanse adolescenten en jongvolwassenen.

Bedankt voor uw bezoek aan Nature.com. De browserversie die u gebruikt, biedt beperkte CSS-ondersteuning. Voor het beste resultaat raden we aan een nieuwere versie van uw browser te gebruiken (of de compatibiliteitsmodus in Internet Explorer uit te schakelen). Om de ondersteuning te blijven garanderen, tonen we de site in de tussentijd zonder opmaak of JavaScript.
Tanden worden beschouwd als de meest nauwkeurige indicator van de leeftijd van het menselijk lichaam en worden vaak gebruikt bij forensische leeftijdsbepaling. We wilden op data mining gebaseerde schattingen van de tandheelkundige leeftijd valideren door de nauwkeurigheid van de schatting en de classificatieprestaties van de 18-jarige leeftijdsgrens te vergelijken met traditionele methoden en op data mining gebaseerde leeftijdsschattingen. In totaal werden 2657 panoramische röntgenfoto's verzameld van Koreaanse en Japanse burgers in de leeftijd van 15 tot 23 jaar. Deze werden verdeeld in een trainingsset, bestaande uit 900 Koreaanse röntgenfoto's, en een interne testset met 857 Japanse röntgenfoto's. We vergeleken de classificatienauwkeurigheid en -efficiëntie van traditionele methoden met de testsets van data mining-modellen. De nauwkeurigheid van de traditionele methode op de interne testset is iets hoger dan die van het data mining-model, maar het verschil is klein (gemiddelde absolute fout <0,21 jaar, wortelgemiddelde kwadratische fout <0,24 jaar). De classificatieprestaties voor de 18-jarige leeftijdsgrens zijn ook vergelijkbaar tussen traditionele methoden en data mining-modellen. Traditionele methoden kunnen dus worden vervangen door dataminingmodellen bij het uitvoeren van forensische leeftijdsbepaling aan de hand van de rijping van de tweede en derde kiezen bij Koreaanse adolescenten en jongvolwassenen.
Het schatten van de leeftijd op basis van het gebit wordt veel gebruikt in de forensische geneeskunde en de kindertandheelkunde. Met name vanwege de hoge correlatie tussen de chronologische leeftijd en de gebitsontwikkeling is leeftijdsbepaling aan de hand van de ontwikkelingsstadia van het gebit een belangrijk criterium voor het vaststellen van de leeftijd van kinderen en adolescenten1,2,3. Bij jongeren kent het schatten van de leeftijd op basis van de gebitsrijpheid echter beperkingen, omdat de gebitsgroei, met uitzondering van de verstandskiezen, bijna voltooid is. Het juridische doel van het vaststellen van de leeftijd van jongeren en adolescenten is het leveren van nauwkeurige schattingen en wetenschappelijk bewijs of zij de meerderjarigheid hebben bereikt. In de medisch-juridische praktijk van adolescenten en jongvolwassenen in Korea werd de leeftijd geschat met behulp van de methode van Lee, en werd een wettelijke leeftijdsgrens van 18 jaar voorspeld op basis van de gegevens gerapporteerd door Oh et al. 5.
Machine learning is een vorm van kunstmatige intelligentie (AI) die herhaaldelijk grote hoeveelheden data leert en classificeert, zelfstandig problemen oplost en data-programmering aanstuurt. Machine learning kan nuttige verborgen patronen in grote hoeveelheden data ontdekken⁶. Klassieke methoden, die arbeidsintensief en tijdrovend zijn, hebben daarentegen mogelijk beperkingen bij het verwerken van grote hoeveelheden complexe data die moeilijk handmatig te verwerken zijn⁷. Daarom zijn er de laatste tijd veel studies uitgevoerd met behulp van de nieuwste computertechnologieën om menselijke fouten te minimaliseren en multidimensionale data efficiënt te verwerken⁸,⁹,¹⁰,¹¹,¹². Met name deep learning wordt veelvuldig gebruikt in de analyse van medische beelden, en er zijn verschillende methoden voor leeftijdschatting door automatische analyse van röntgenfoto's gerapporteerd die de nauwkeurigheid en efficiëntie van leeftijdschatting verbeteren¹³,¹⁴,¹⁵,¹⁶,¹⁷,¹⁸,¹⁹,²⁰. Halabi et al.¹³ ontwikkelden bijvoorbeeld een machine learning-algoritme gebaseerd op convolutionele neurale netwerken (CNN) om de skeletleeftijd te schatten aan de hand van röntgenfoto's van kinderhanden. Deze studie stelt een model voor dat machinaal leren toepast op medische beelden en laat zien dat deze methoden de diagnostische nauwkeurigheid kunnen verbeteren. Li et al.14 schatten de leeftijd aan de hand van röntgenfoto's van het bekken met behulp van een CNN met deep learning en vergeleken deze met regressieresultaten op basis van de schatting van het ossificatiestadium. Ze ontdekten dat het CNN-model met deep learning dezelfde prestaties leverde bij het schatten van de leeftijd als het traditionele regressiemodel. De studie van Guo et al. [15] evalueerde de classificatieprestaties van CNN-technologie op basis van orthofoto's van het gebit, waarbij de tolerantie voor leeftijdsclassificatie werd onderzocht. De resultaten van het CNN-model toonden aan dat mensen betere resultaten behaalden bij de leeftijdsclassificatie.
De meeste studies naar leeftijdschatting met behulp van machine learning maken gebruik van deep learning-methoden13,14,15,16,17,18,19,20. Leeftijdschatting op basis van deep learning zou nauwkeuriger zijn dan traditionele methoden. Deze aanpak biedt echter weinig mogelijkheden om de wetenschappelijke basis voor leeftijdschattingen te presenteren, zoals de leeftijdsindicatoren die in de schattingen worden gebruikt. Er bestaat ook een juridisch geschil over wie de inspecties uitvoert. Daarom is leeftijdschatting op basis van deep learning moeilijk te accepteren door administratieve en gerechtelijke instanties. Datamining (DM) is een techniek die niet alleen verwachte, maar ook onverwachte informatie kan ontdekken als methode om nuttige correlaties te vinden tussen grote hoeveelheden data6,21,22. Machine learning wordt vaak gebruikt in datamining, en zowel datamining als machine learning gebruiken dezelfde sleutelalgoritmen om patronen in data te ontdekken. Leeftijdschatting op basis van tandheelkundige ontwikkeling is gebaseerd op de beoordeling van de onderzoeker van de rijpheid van de betreffende tanden, en deze beoordeling wordt uitgedrukt als een stadium voor elke betreffende tand. DM kan worden gebruikt om de correlatie tussen het stadium van de tandheelkundige beoordeling en de werkelijke leeftijd te analyseren en heeft de potentie om traditionele statistische analyses te vervangen. Door DM-technieken toe te passen op leeftijdschatting, kunnen we machine learning implementeren in forensische leeftijdschatting zonder ons zorgen te hoeven maken over juridische aansprakelijkheid. Er zijn verschillende vergelijkende studies gepubliceerd over mogelijke alternatieven voor traditionele handmatige methoden die in de forensische praktijk worden gebruikt en op EBM gebaseerde methoden voor het bepalen van de tandheelkundige leeftijd. Shen et al.23 toonden aan dat het DM-model nauwkeuriger is dan de traditionele Camerer-formule. Galibourg et al.24 pasten verschillende DM-methoden toe om de leeftijd te voorspellen volgens het Demirdjian-criterium25 en de resultaten toonden aan dat de DM-methode beter presteerde dan de Demirdjian- en Willems-methoden bij het schatten van de leeftijd van de Franse bevolking.
Om de dentale leeftijd van Koreaanse adolescenten en jongvolwassenen te schatten, wordt de methode van Lee⁴ veelvuldig gebruikt in de Koreaanse forensische praktijk. Deze methode maakt gebruik van traditionele statistische analyses (zoals meervoudige regressie) om de relatie tussen Koreaanse proefpersonen en chronologische leeftijd te onderzoeken. In deze studie worden leeftijdschattingsmethoden die zijn verkregen met behulp van traditionele statistische methoden gedefinieerd als "traditionele methoden". De methode van Lee is een traditionele methode en de nauwkeurigheid ervan is bevestigd door Oh et al.⁵; de toepasbaarheid van leeftijdschatting op basis van het DM-model in de Koreaanse forensische praktijk is echter nog steeds twijfelachtig. Ons doel was om de potentiële bruikbaarheid van leeftijdschatting op basis van het DM-model wetenschappelijk te valideren. Het doel van deze studie was (1) de nauwkeurigheid van twee DM-modellen bij het schatten van de dentale leeftijd te vergelijken en (2) de classificatieprestaties van 7 DM-modellen op 18-jarige leeftijd te vergelijken met die verkregen met behulp van traditionele statistische methoden. Rijpheid van de tweede en derde kiezen in beide kaken.
Gemiddelden en standaarddeviaties van de chronologische leeftijd per stadium en tandtype worden online weergegeven in aanvullende tabel S1 (trainingsset), aanvullende tabel S2 (interne testset) en aanvullende tabel S3 (externe testset). De kappa-waarden voor intra- en interobserverbetrouwbaarheid verkregen uit de trainingsset waren respectievelijk 0,951 en 0,947. P-waarden en 95%-betrouwbaarheidsintervallen voor de kappa-waarden worden weergegeven in online aanvullende tabel S4. De kappa-waarde werd geïnterpreteerd als "bijna perfect", in overeenstemming met de criteria van Landis en Koch26.
Bij het vergelijken van de gemiddelde absolute fout (MAE) presteert de traditionele methode iets beter dan het DM-model voor alle geslachten en in de externe testset voor mannen, met uitzondering van de meerlaagse perceptron (MLP). Het verschil tussen het traditionele model en het DM-model in de interne MAE-testset was 0,12–0,19 jaar voor mannen en 0,17–0,21 jaar voor vrouwen. Voor de externe testbatterij zijn de verschillen kleiner (0,001–0,05 jaar voor mannen en 0,05–0,09 jaar voor vrouwen). Bovendien is de wortelgemiddelde kwadratische fout (RMSE) iets lager dan bij de traditionele methode, met kleinere verschillen (0,17–0,24, 0,2–0,24 voor de interne testset voor mannen en 0,03–0,07, 0,04–0,08 voor de externe testset). MLP presteert iets beter dan de enkellaagse perceptron (SLP), behalve in het geval van de externe testset voor vrouwen. Voor MAE en RMSE scoort de externe testset hoger dan de interne testset voor alle geslachten en modellen. Alle MAE- en RMSE-waarden worden weergegeven in Tabel 1 en Figuur 1.
MAE en RMSE van traditionele en data mining regressiemodellen. Gemiddelde absolute fout (MAE), wortel van de gemiddelde kwadratische fout (RMSE), enkellaags perceptron (SLP), meerlaags perceptron (MLP), traditionele CM-methode.
De classificatieprestaties (met een afkapwaarde van 18 jaar) van de traditionele en DM-modellen werden aangetoond in termen van sensitiviteit, specificiteit, positief voorspellende waarde (PPV), negatief voorspellende waarde (NPV) en het oppervlak onder de receiver operating characteristic curve (AUROC) 27 (Tabel 2, Figuur 2 en Aanvullende Figuur 1 online). Wat betreft de sensitiviteit van de interne testbatterij presteerden de traditionele methoden het best bij mannen en het slechtst bij vrouwen. Het verschil in classificatieprestaties tussen traditionele methoden en SD is echter 9,7% voor mannen (MLP) en slechts 2,4% voor vrouwen (XGBoost). Onder de DM-modellen vertoonde logistische regressie (LR) een betere sensitiviteit bij beide geslachten. Wat betreft de specificiteit van de interne testset werd waargenomen dat de vier SD-modellen goed presteerden bij mannen, terwijl het traditionele model beter presteerde bij vrouwen. De verschillen in classificatieprestaties voor mannen en vrouwen zijn respectievelijk 13,3% (MLP) en 13,1% (MLP), wat aangeeft dat het verschil in classificatieprestaties tussen modellen groter is dan het verschil in sensitiviteit. Van de DM-modellen presteerden de support vector machine (SVM), decision tree (DT) en random forest (RF) modellen het beste bij mannen, terwijl het LR-model het beste presteerde bij vrouwen. De AUROC van het traditionele model en alle SD-modellen was groter dan 0,925 (k-nearest neighbor (KNN) bij mannen), wat een uitstekende classificatieprestatie aantoont bij het onderscheiden van 18-jarige samples28. Voor de externe testset was er een afname in classificatieprestatie in termen van sensitiviteit, specificiteit en AUROC vergeleken met de interne testset. Bovendien varieerde het verschil in sensitiviteit en specificiteit tussen de classificatieprestatie van de beste en slechtste modellen van 10% tot 25% en was dit groter dan het verschil in de interne testset.
Gevoeligheid en specificiteit van data mining classificatiemodellen vergeleken met traditionele methoden met een afkapwaarde van 18 jaar. KNN (k-nearest neighbor), SVM (support vector machine), LR (logistische regressie), DT (decision tree), RF (random forest), XGB (XGBoost), MLP (multilayer perceptron), traditionele CM-methode.
De eerste stap in dit onderzoek was het vergelijken van de nauwkeurigheid van schattingen van de tandleeftijd verkregen met zeven DM-modellen met die verkregen met traditionele regressie. MAE en RMSE werden geëvalueerd in interne testsets voor beide geslachten, en het verschil tussen de traditionele methode en het DM-model varieerde van 44 tot 77 dagen voor MAE en van 62 tot 88 dagen voor RMSE. Hoewel de traditionele methode in dit onderzoek iets nauwkeuriger was, is het moeilijk te concluderen of een dergelijk klein verschil klinische of praktische betekenis heeft. Deze resultaten geven aan dat de nauwkeurigheid van de schatting van de tandleeftijd met behulp van het DM-model vrijwel gelijk is aan die van de traditionele methode. Directe vergelijking met resultaten uit eerdere onderzoeken is moeilijk, omdat geen enkel onderzoek de nauwkeurigheid van DM-modellen heeft vergeleken met traditionele statistische methoden met dezelfde techniek voor het registreren van tanden in dezelfde leeftijdsgroep als in dit onderzoek. Galibourg et al.24 vergeleken MAE en RMSE tussen twee traditionele methoden (Demirjian-methode25 en Willems-methode29) en 10 DM-modellen in een Franse populatie van 2 tot 24 jaar. Ze rapporteerden dat alle DM-modellen nauwkeuriger waren dan traditionele methoden, met verschillen van respectievelijk 0,20 en 0,38 jaar in MAE en 0,25 en 0,47 jaar in RMSE vergeleken met de Willems- en Demirdjian-methoden. De discrepantie tussen het SD-model en traditionele methoden, zoals aangetoond in de Halibourg-studie, houdt rekening met talrijke rapporten30,31,32,33 waaruit blijkt dat de Demirdjian-methode de tandleeftijd niet nauwkeurig schat in populaties anders dan de Frans-Canadezen waarop de studie was gebaseerd. Tai et al.34 gebruikten het MLP-algoritme om de tandleeftijd te voorspellen aan de hand van 1636 Chinese orthodontische foto's en vergeleken de nauwkeurigheid ervan met de resultaten van de Demirdjian- en Willems-methode. Ze rapporteerden dat MLP een hogere nauwkeurigheid heeft dan traditionele methoden. Het verschil tussen de Demirdjian-methode en de traditionele methode is <0,32 jaar, en met de Willems-methode 0,28 jaar, wat vergelijkbaar is met de resultaten van de huidige studie. De resultaten van deze eerdere studies24,34 komen ook overeen met de resultaten van de huidige studie, en de nauwkeurigheid van de leeftijdschatting met het DM-model en de traditionele methode is vergelijkbaar. Op basis van de gepresenteerde resultaten kunnen we echter slechts voorzichtig concluderen dat het gebruik van DM-modellen voor leeftijdschatting bestaande methoden kan vervangen, vanwege het gebrek aan vergelijkende en referentiestudies. Vervolgstudies met grotere steekproeven zijn nodig om de in deze studie verkregen resultaten te bevestigen.
Van de studies die de nauwkeurigheid van SD bij het schatten van de tandleeftijd hebben onderzocht, lieten sommige een hogere nauwkeurigheid zien dan onze studie. Stepanovsky et al. 35 pasten 22 SD-modellen toe op panoramische röntgenfoto's van 976 Tsjechische inwoners in de leeftijd van 2,7 tot 20,5 jaar en testten de nauwkeurigheid van elk model. Ze beoordeelden de ontwikkeling van in totaal 16 permanente tanden in de linker boven- en onderkaak met behulp van de classificatiecriteria voorgesteld door Moorrees et al. 36. De MAE varieert van 0,64 tot 0,94 jaar en de RMSE van 0,85 tot 1,27 jaar, wat nauwkeuriger is dan de twee DM-modellen die in deze studie zijn gebruikt. Shen et al. 23 gebruikten de Cameriere-methode om de tandleeftijd van zeven permanente tanden in de linker onderkaak te schatten bij inwoners van Oost-China in de leeftijd van 5 tot 13 jaar en vergeleken deze met leeftijden geschat met behulp van lineaire regressie, SVM en RF. Ze toonden aan dat alle drie de DM-modellen een hogere nauwkeurigheid hebben vergeleken met de traditionele Cameriere-formule. De MAE en RMSE in de studie van Shen waren lager dan die in het DM-model in deze studie. De verhoogde precisie van de studies van Stepanovsky et al. 35 en Shen et al. 23 kan te wijten zijn aan de inclusie van jongere proefpersonen in hun onderzoeksgroepen. Omdat leeftijdschattingen voor deelnemers met zich ontwikkelende tanden nauwkeuriger worden naarmate het aantal tanden toeneemt tijdens de tandheelkundige ontwikkeling, kan de nauwkeurigheid van de resulterende leeftijdschattingsmethode in het gedrang komen wanneer de deelnemers jonger zijn. Bovendien is de fout in de leeftijdschatting van MLP iets kleiner dan die van SLP, wat betekent dat MLP nauwkeuriger is dan SLP. MLP wordt als iets beter beschouwd voor leeftijdschatting, mogelijk vanwege de verborgen lagen in MLP38. Er is echter een uitzondering voor de buitenste steekproef van vrouwen (SLP 1,45, MLP 1,49). De bevinding dat MLP nauwkeuriger is dan SLP bij het bepalen van de leeftijd vereist aanvullende retrospectieve studies.
De classificatieprestaties van het DM-model en de traditionele methode bij een leeftijdsgrens van 18 jaar werden ook vergeleken. Alle geteste SD-modellen en traditionele methoden op de interne testset lieten praktisch acceptabele discriminatieniveaus zien voor de steekproef van 18-jarigen. De sensitiviteit voor mannen en vrouwen was respectievelijk hoger dan 87,7% en 94,9%, en de specificiteit was hoger dan 89,3% en 84,7%. De AUROC van alle geteste modellen is ook hoger dan 0,925. Voor zover wij weten, heeft geen enkele studie de prestaties van het DM-model voor classificatie op basis van tandheelkundige rijpheid bij 18-jarigen getest. We kunnen de resultaten van deze studie vergelijken met de classificatieprestaties van deep learning-modellen op panoramische röntgenfoto's. Guo et al.15 berekenden de classificatieprestaties van een op CNN gebaseerd deep learning-model en een handmatige methode gebaseerd op de methode van Demirjian voor een bepaalde leeftijdsgrens. De sensitiviteit en specificiteit van de handmatige methode waren respectievelijk 87,7% en 95,5%, terwijl de sensitiviteit en specificiteit van het CNN-model respectievelijk 89,2% en 86,6% overtroffen. De onderzoekers concludeerden dat deep learning-modellen de handmatige beoordeling bij het classificeren van leeftijdsdrempels kunnen vervangen of zelfs overtreffen. De resultaten van deze studie toonden vergelijkbare classificatieprestaties; men is van mening dat classificatie met behulp van deep learning-modellen traditionele statistische methoden voor leeftijdschatting kan vervangen. Van de modellen was deep learning LR het beste model qua sensitiviteit voor de mannelijke steekproef en qua sensitiviteit en specificiteit voor de vrouwelijke steekproef. LR behaalde de tweede plaats qua specificiteit voor mannen. Bovendien wordt LR beschouwd als een van de gebruiksvriendelijkere deep learning-modellen en is het minder complex en moeilijk te verwerken. Op basis van deze resultaten werd LR beschouwd als het beste classificatiemodel voor de leeftijdsgrens van 18-jarigen in de Koreaanse populatie.
Over het algemeen was de nauwkeurigheid van de leeftijdschatting of de classificatieprestaties op de externe testset slecht of lager in vergelijking met de resultaten op de interne testset. Sommige rapporten geven aan dat de classificatienauwkeurigheid of -efficiëntie afneemt wanneer leeftijdschattingen gebaseerd op de Koreaanse bevolking worden toegepast op de Japanse bevolking5,39, en een soortgelijk patroon werd in deze studie gevonden. Deze verslechterende trend werd ook waargenomen in het DM-model. Om de leeftijd nauwkeurig te schatten, zelfs bij gebruik van DM in het analyseproces, zouden methoden afgeleid van gegevens van de eigen bevolking, zoals traditionele methoden, de voorkeur moeten krijgen5,39,40,41,42. Omdat het onduidelijk is of deep learning-modellen vergelijkbare trends vertonen, zijn studies nodig die de classificatienauwkeurigheid en -efficiëntie vergelijken met behulp van traditionele methoden, DM-modellen en deep learning-modellen op dezelfde datasets, om te bevestigen of kunstmatige intelligentie deze raciale verschillen in beperkte leeftijdsbeoordelingen kan overbruggen.
We tonen aan dat traditionele methoden kunnen worden vervangen door leeftijdschatting op basis van het DM-model in de forensische leeftijdschattingspraktijk in Korea. We hebben ook de mogelijkheid ontdekt om machine learning toe te passen voor forensische leeftijdsbepaling. Er zijn echter duidelijke beperkingen, zoals het onvoldoende aantal deelnemers in deze studie om de resultaten definitief vast te stellen, en het gebrek aan eerdere studies om de resultaten van deze studie te vergelijken en te bevestigen. In de toekomst zouden DM-studies moeten worden uitgevoerd met een groter aantal monsters en meer diverse populaties om de praktische toepasbaarheid ervan te verbeteren in vergelijking met traditionele methoden. Om de haalbaarheid van het gebruik van kunstmatige intelligentie voor leeftijdschatting in verschillende populaties te valideren, zijn toekomstige studies nodig om de classificatienauwkeurigheid en -efficiëntie van DM- en deep learning-modellen te vergelijken met traditionele methoden in dezelfde monsters.
Voor dit onderzoek werden 2657 orthografische foto's gebruikt, verzameld van Koreaanse en Japanse volwassenen in de leeftijd van 15 tot 23 jaar. De Koreaanse röntgenfoto's werden verdeeld in 900 trainingssets (19,42 ± 2,65 jaar) en 900 interne testsets (19,52 ± 2,59 jaar). De trainingsset werd verzameld in één instelling (Seoul St. Mary's Hospital) en de interne testsets in twee instellingen (Seoul National University Dental Hospital en Yonsei University Dental Hospital). Daarnaast werden 857 röntgenfoto's verzameld uit een andere populatiegebaseerde dataset (Iwate Medical University, Japan) voor externe tests. Röntgenfoto's van Japanse proefpersonen (19,31 ± 2,60 jaar) werden geselecteerd als de externe testset. De gegevens werden retrospectief verzameld om de stadia van tandheelkundige ontwikkeling te analyseren aan de hand van panoramische röntgenfoto's die tijdens tandheelkundige behandelingen waren gemaakt. Alle verzamelde gegevens waren geanonimiseerd, met uitzondering van geslacht, geboortedatum en datum van de röntgenfoto. De inclusie- en exclusiecriteria waren dezelfde als in eerder gepubliceerde studies 4, 5. De werkelijke leeftijd van de steekproef werd berekend door de geboortedatum af te trekken van de datum waarop de röntgenfoto werd gemaakt. De steekproefgroep werd verdeeld in negen leeftijdsgroepen. De leeftijds- en geslachtsverdeling is weergegeven in Tabel 3. Deze studie werd uitgevoerd in overeenstemming met de Verklaring van Helsinki en goedgekeurd door de ethische commissie (IRB) van het Seoul St. Mary's Hospital van de Katholieke Universiteit van Korea (KC22WISI0328). Vanwege het retrospectieve karakter van deze studie kon niet van alle patiënten die een radiografisch onderzoek ondergingen voor therapeutische doeleinden, informed consent worden verkregen. De ethische commissie van het Seoul Korea University St. Mary's Hospital (IRB) zag daarom af van de eis tot informed consent.
De ontwikkelingsstadia van de tweede en derde kiezen in beide bovenkaak werden beoordeeld volgens de criteria van Demircan25. Slechts één tand werd geselecteerd als hetzelfde type tand aan de linker- en rechterkant van elke kaak werd gevonden. Als homologe tanden aan beide zijden zich in verschillende ontwikkelingsstadia bevonden, werd de tand met het laagste ontwikkelingsstadium geselecteerd om rekening te houden met de onzekerheid in de geschatte leeftijd. Honderd willekeurig geselecteerde röntgenfoto's uit de trainingsset werden beoordeeld door twee ervaren waarnemers om de interobserverbetrouwbaarheid te testen na precalibratie om het stadium van tandheelkundige rijping te bepalen. De intraobserverbetrouwbaarheid werd tweemaal beoordeeld met tussenpozen van drie maanden door de primaire waarnemer.
Het geslacht en het ontwikkelingsstadium van de tweede en derde kiezen van elke kaak in de trainingsset werden geschat door een primaire waarnemer die getraind was met verschillende DM-modellen, waarbij de werkelijke leeftijd als doelwaarde werd ingesteld. SLP- en MLP-modellen, die veelvuldig worden gebruikt in machine learning, werden getest tegen regressiealgoritmen. Het DM-model combineert lineaire functies op basis van de ontwikkelingsstadia van de vier tanden en combineert deze gegevens om de leeftijd te schatten. SLP is het eenvoudigste neurale netwerk en bevat geen verborgen lagen. SLP werkt op basis van drempeloverdracht tussen knooppunten. Het SLP-model in regressie is wiskundig vergelijkbaar met meervoudige lineaire regressie. In tegenstelling tot het SLP-model heeft het MLP-model meerdere verborgen lagen met niet-lineaire activeringsfuncties. Onze experimenten gebruikten een verborgen laag met slechts 20 verborgen knooppunten met niet-lineaire activeringsfuncties. Gradient Descent werd gebruikt als optimalisatiemethode en MAE en RMSE als verliesfunctie om ons machine learning-model te trainen. Het best verkregen regressiemodel werd toegepast op de interne en externe testsets en de leeftijd van de tanden werd geschat.
Er is een classificatiealgoritme ontwikkeld dat de rijpheid van vier tanden in de trainingsset gebruikt om te voorspellen of een voorbeeld 18 jaar oud is of niet. Om het model te bouwen, hebben we zeven representatieve machine learning-algoritmen afgeleid6,43: (1) LR, (2) KNN, (3) SVM, (4) DT, (5) RF, (6) XGBoost en (7) MLP. LR is een van de meest gebruikte classificatiealgoritmen44. Het is een supervised learning-algoritme dat regressie gebruikt om de waarschijnlijkheid te voorspellen dat data tot een bepaalde categorie behoort (van 0 tot 1) en de data classificeert als behorend tot een waarschijnlijker categorie op basis van deze waarschijnlijkheid; het wordt voornamelijk gebruikt voor binaire classificatie. KNN is een van de eenvoudigste machine learning-algoritmen45. Wanneer het nieuwe invoerdata krijgt, zoekt het k data die dicht bij de bestaande set liggen en classificeert deze vervolgens in de klasse met de hoogste frequentie. We hebben 3 ingesteld voor het aantal overwogen buren (k). SVM is een algoritme dat de afstand tussen twee klassen maximaliseert door een kernelfunctie te gebruiken om de lineaire ruimte uit te breiden naar een niet-lineaire ruimte, velden genaamd46. Voor dit model gebruiken we bias = 1, power = 1 en gamma = 1 als hyperparameters voor de polynomiale kernel. DT is in diverse vakgebieden toegepast als een algoritme om een ​​volledige dataset te verdelen in verschillende subgroepen door beslissingsregels weer te geven in een boomstructuur47. Het model is geconfigureerd met een minimum aantal records per knooppunt van 2 en gebruikt de Gini-index als kwaliteitsmaatstaf. RF is een ensemblemethode die meerdere DT's combineert om de prestaties te verbeteren met behulp van een bootstrap-aggregatiemethode die een zwakke classifier genereert voor elk monster door willekeurig meerdere keren monsters van dezelfde grootte uit de oorspronkelijke dataset te trekken48. We gebruikten 100 bomen, 10 boomdieptes, 1 minimale knooppuntgrootte en de Gini-admixture-index als criteria voor knooppuntscheiding. De classificatie van nieuwe data wordt bepaald door een meerderheidsstemming. XGBoost is een algoritme dat boosting-technieken combineert met een methode die de fout tussen de werkelijke en voorspelde waarden van het vorige model als trainingsdata gebruikt en de fout versterkt met behulp van gradiënten49. Het is een veelgebruikt algoritme vanwege de goede prestaties en resource-efficiëntie, evenals de hoge betrouwbaarheid als overfitting-correctiefunctie. Het model is uitgerust met 400 ondersteunende wielen. MLP is een neuraal netwerk waarin een of meer perceptrons meerdere lagen vormen met een of meer verborgen lagen tussen de invoer- en uitvoerlagen38. Hiermee kan niet-lineaire classificatie worden uitgevoerd, waarbij wanneer een invoerlaag wordt toegevoegd en een resultaatwaarde wordt verkregen, de voorspelde resultaatwaarde wordt vergeleken met de werkelijke resultaatwaarde en de fout wordt teruggepropagereerd. We hebben een verborgen laag gecreëerd met 20 verborgen neuronen in elke laag. Elk model dat we hebben ontwikkeld, werd toegepast op interne en externe datasets om de classificatieprestaties te testen door de sensitiviteit, specificiteit, PPV, NPV en AUROC te berekenen. De sensitiviteit wordt gedefinieerd als de verhouding tussen het aantal deelnemers in een steekproef waarvan de leeftijd wordt geschat op 18 jaar of ouder en het aantal deelnemers in een steekproef waarvan de leeftijd wordt geschat op 18 jaar of ouder. De specificiteit is het aandeel deelnemers jonger dan 18 jaar en deelnemers waarvan de leeftijd wordt geschat op jonger dan 18 jaar.
De tandheelkundige stadia die in de trainingsset werden beoordeeld, werden omgezet in numerieke stadia voor statistische analyse. Multivariate lineaire en logistische regressie werden uitgevoerd om voorspellende modellen voor elk geslacht te ontwikkelen en regressieformules af te leiden die gebruikt kunnen worden om de leeftijd te schatten. We gebruikten deze formules om de tandleeftijd te schatten voor zowel interne als externe testsets. Tabel 4 toont de regressie- en classificatiemodellen die in dit onderzoek zijn gebruikt.
De intra- en interobserverbetrouwbaarheid werd berekend met behulp van Cohen's kappa-statistiek. Om de nauwkeurigheid van DM- en traditionele regressiemodellen te testen, berekenden we MAE en RMSE met behulp van de geschatte en werkelijke leeftijden van de interne en externe testsets. Deze fouten worden vaak gebruikt om de nauwkeurigheid van modelvoorspellingen te evalueren. Hoe kleiner de fout, hoe hoger de nauwkeurigheid van de voorspelling24. Vergelijk de MAE en RMSE van interne en externe testsets berekend met behulp van DM en traditionele regressie. De classificatieprestaties van de 18-jarige grens in traditionele statistiek werden beoordeeld met behulp van een 2 × 2 contingentietabel. De berekende sensitiviteit, specificiteit, PPV, NPV en AUROC van de testset werden vergeleken met de gemeten waarden van het DM-classificatiemodel. Gegevens worden weergegeven als gemiddelde ± standaarddeviatie of aantal (%) afhankelijk van de gegevenskenmerken. Tweezijdige P-waarden < 0,05 werden als statistisch significant beschouwd. Alle routinematige statistische analyses werden uitgevoerd met SAS versie 9.4 (SAS Institute, Cary, NC). Het DM-regressiemodel is geïmplementeerd in Python met behulp van de Keras50 2.2.4-backend en Tensorflow51 1.8.0, specifiek voor wiskundige bewerkingen. Het DM-classificatiemodel is geïmplementeerd in de Waikato Knowledge Analysis Environment en het Konstanz Information Miner (KNIME) 4.6.152-analyseplatform.
De auteurs erkennen dat de gegevens ter ondersteuning van de conclusies van het onderzoek te vinden zijn in het artikel en de aanvullende materialen. De datasets die tijdens het onderzoek zijn gegenereerd en/of geanalyseerd, zijn op redelijk verzoek verkrijgbaar bij de corresponderende auteur.
Ritz-Timme, S. et al. Leeftijdsbepaling: stand van de techniek om te voldoen aan de specifieke eisen van de forensische praktijk. Internationality. J. Legal medicine. 113, 129–136 (2000).
Schmeling, A., Reisinger, W., Geserik, G., en Olze, A. Huidige stand van zaken met betrekking tot forensische leeftijdsbepaling van levende personen voor strafrechtelijke vervolging. Forensische geneeskunde. Pathologie. 1, 239–246 (2005).
Pan, J. et al. Een aangepaste methode voor het bepalen van de tandleeftijd van kinderen van 5 tot 16 jaar in Oost-China. Klinisch. Mondeling onderzoek. 25, 3463–3474 (2021).
Lee, SS e.a. Chronologie van de ontwikkeling van de tweede en derde kiezen bij Koreanen en de toepassing ervan voor forensische leeftijdsbepaling. Internationality. J. Legal medicine. 124, 659–665 (2010).
Oh, S., Kumagai, A., Kim, SY en Lee, SS. Nauwkeurigheid van leeftijdschatting en schatting van de 18-jarige leeftijdsgrens op basis van de rijping van de tweede en derde kiezen bij Koreanen en Japanners. PLoS ONE 17, e0271247 (2022).
Kim, JY, et al. Preoperatieve machine learning-gebaseerde data-analyse kan de uitkomst van slaapchirurgie bij patiënten met OSA voorspellen. The Science. Rapport 11, 14911 (2021).
Han, M. et al. Nauwkeurige leeftijdschatting door middel van machinaal leren met of zonder menselijke tussenkomst? Internationaliteit. J. Legal medicine. 136, 821–831 (2022).
Khan, S. en Shaheen, M. Van datamining naar datamining. J.Information. the science. https://doi.org/10.1177/01655515211030872 (2021).
Khan, S. en Shaheen, M. WisRule: Het eerste cognitieve algoritme voor het vinden van associatieregels. J.Information. the science. https://doi.org/10.1177/01655515221108695 (2022).
Shaheen M. en Abdullah U. Karm: Traditionele datamining gebaseerd op contextgebaseerde associatieregels. calculeren. Matt. vervolg. 68, 3305–3322 (2021).
Muhammad M., Rehman Z., Shaheen M., Khan M. en Habib M. Detectie van semantische gelijkenis op basis van tekstdata met behulp van deep learning. inform. technologies. control. https://doi.org/10.5755/j01.itc.49.4.27118 (2020).
Tabish, M., Tanoli, Z., en Shahin, M. Een systeem voor het herkennen van activiteit in sportvideo's. Multimedia. Tools Applications https://doi.org/10.1007/s11042-021-10519-6 (2021).
Halabi, SS et al. RSNA Machine Learning Challenge in Pediatric Bone Age. Radiology 290, 498–503 (2019).
Li, Y. et al. Forensische leeftijdschatting op basis van bekkenröntgenfoto's met behulp van deep learning. EURO. radiation. 29, 2322–2329 (2019).
Guo, YC, et al. Nauwkeurige leeftijdsclassificatie met behulp van handmatige methoden en diepe convolutionele neurale netwerken op basis van orthografische projectiebeelden. Internationality. J. Legal medicine. 135, 1589–1597 (2021).
Alabama Dalora et al. Schatting van de botleeftijd met behulp van verschillende machine learning-methoden: een systematisch literatuuronderzoek en meta-analyse. PLoS ONE 14, e0220242 (2019).
Du, H., Li, G., Cheng, K., en Yang, J. Populatiespecifieke leeftijdschatting van Afro-Amerikanen en Chinezen op basis van pulpakamervolumes van eerste molaren met behulp van cone-beam computertomografie. Internationality. J. Legal medicine. 136, 811–819 (2022).
Kim S., Lee YH, Noh YK, Park FK en Oh KS. Het bepalen van leeftijdsgroepen van levende mensen met behulp van op kunstmatige intelligentie gebaseerde afbeeldingen van eerste kiezen. The Science. Rapport 11, 1073 (2021).
Stern, D., Payer, C., Giuliani, N., en Urschler, M. Automatische leeftijdschatting en classificatie van de meerderheidsleeftijd op basis van multivariate MRI-gegevens. IEEE J. Biomed. Health Alerts. 23, 1392–1403 (2019).
Cheng, Q., Ge, Z., Du, H. en Li, G. Leeftijdsschatting op basis van 3D-segmentatie van de pulpakamer van eerste molaren uit cone beam computertomografie door integratie van deep learning en level sets. Internationality. J. Legal medicine. 135, 365–373 (2021).
Wu, WT, et al. Datamining in klinische big data: gemeenschappelijke databases, stappen en methodenmodellen. World. medicine. resource. 8, 44 (2021).
Yang, J. et al. Inleiding tot medische databases en dataminingtechnologieën in het big data-tijdperk. J. Avid. Basisgeneeskunde. 13, 57–69 (2020).
Shen, S. et al. Camerer's methode voor het schatten van de tandleeftijd met behulp van machinaal leren. BMC Oral Health 21, 641 (2021).
Galliburg A. et al. Vergelijking van verschillende machine learning-methoden voor het voorspellen van de tandleeftijd met behulp van de Demirdjian-stadiëringsmethode. Internationality. J. Legal medicine. 135, 665–675 (2021).
Demirdjian, A., Goldstein, H. en Tanner, JM. Een nieuw systeem voor het beoordelen van de tandleeftijd. Snort. Biology. 45, 211–227 (1973).
Landis, JR, en Koch, GG. Metingen van overeenstemming tussen waarnemers bij categorische gegevens. Biometrics 33, 159–174 (1977).
Bhattacharjee S, Prakash D, Kim C, Kim HK en Choi HK. Textuur-, morfologische en statistische analyse van tweedimensionale magnetische resonantiebeelden met behulp van kunstmatige intelligentietechnieken voor de differentiatie van primaire hersentumoren. Gezondheidsinformatie. bron. https://doi.org/10.4258/hir.2022.28.1.46 (2022).


Geplaatst op: 4 januari 2024