O metodă nouă de grupare a datelor descoperă comportamente ascunse pe care alte metode le ratează
O metodă nouă de la Universitatea Duisburg-Essen grupează datele după ecuația care le descrie, nu doar după cât de apropiate sunt numeric, și găsește tipare pe care metodele clasice le ratează.
Cercetători de la Universitatea Duisburg-Essen din Germania au dezvoltat o metodă nouă de analiză a datelor, numită CluBS (Clustering Behavioral Similarity), care grupează punctele dintr-un set de date în funcție de dacă pot fi descrise de aceeași ecuație matematică, nu doar după cât de apropiate sunt numeric unele de altele, cum fac metodele clasice de clustering.
Diferența contează pentru că multe seturi de date din lumea reală nu urmează un singur tipar. Un set poate conține mai multe comportamente diferite amestecate, iar o metodă care încearcă să le descrie pe toate cu un singur model universal ratează exact ceea ce e interesant, momentele în care sistemul se comportă altfel.
Cum funcționează
CluBS lucrează iterativ. Mai întâi folosește regresia simbolică, o tehnică ce încearcă să găsească automat funcția matematică ce descrie cel mai bine un set inițial de puncte, apoi identifică ce alte puncte din restul datelor respectă aceeași funcție și le adaugă în același grup, numit „CluB”. Procesul se repetă apoi pe datele rămase, până când toate comportamentele distincte din set sunt identificate separat.
Echipa, formată din Peter Zdankin, Arne Kummerow și profesorul Torben Weis de la Institutul de Cercetare Paluno, a testat metoda pe 211 seturi de date, atât reale, cât și generate artificial, și a descoperit că, în multe cazuri, datele erau descrise mai bine de mai multe ecuații separate decât de un singur model general. Rezultatele au fost publicate la cea de-a 32-a Conferință ACM SIGKDD din 2026, una dintre conferințele de referință din domeniul extragerii de cunoștințe din date.
Unde ar putea ajuta
Cercetătorii văd aplicații potențiale în analiza sistemelor tehnice, biologice și economice, oriunde comportamentul variază în funcție de condiții, de la funcționarea unor echipamente industriale până la modele economice sau biologice cu regimuri diferite de funcționare.
Metoda are însă o limită clară deocamdată: are nevoie de valori țintă cunoscute pentru a funcționa, adică nu poate fi folosită direct pentru a face predicții pe date incomplete. Următorul pas al echipei este să adapteze CluBS pentru exact acest scenariu, predicții pe seturi de date unde nu toate valorile sunt cunoscute dinainte.
Sursă: Phys.org