TabFM: Το τέλος του manual feature engineering στα δεδομένα

TabFM: Το τέλος του manual feature engineering στα δεδομένα

Η Google φέρνει την επανάσταση στην ανάλυση πινάκων δεδομένων με το TabFM, ένα νέο foundation model που υπόσχεται να απλοποιήσει τις διαδικασίες πρόβλεψης και ταξινόμησης, χωρίς την ανάγκη για επίπονη χειροκίνητη εκπαίδευση μοντέλων.

Μέχρι σήμερα, η ανάλυση δομημένων δεδομένων (tabular data) βασιζόταν σε αλγόριθμους όπως τα XGBoost και random forests. Ωστόσο, η διαδικασία αυτή απαιτούσε ώρες χειροκίνητου feature engineering και εκτεταμένη βελτιστοποίηση υπερπαραμέτρων. Το TabFM αλλάζει τα δεδομένα, εισάγοντας τη λογική του "zero-shot" learning, επιτρέποντας στο μοντέλο να κάνει προβλέψεις σε νέα σύνολα δεδομένων με ένα και μόνο πέρασμα (forward pass).

Η καινοτομία του TabFM έγκειται στην αρχιτεκτονική του, η οποία συνδυάζει την προσοχή σε σειρές και στήλες (alternating row and column attention) με την αποδοτική συμπίεση διανυσμάτων. Αντί να εκπαιδεύεται για κάθε επιμέρους εργασία, το μοντέλο μαθαίνει από το πλαίσιο (in-context learning), καθιστώντας το εξαιρετικά ευέλικτο και γρήγορο για εφαρμογές όπως η πρόβλεψη churn ή ο εντοπισμός οικονομικής απάτης.

Ένα από τα πιο ενδιαφέροντα στοιχεία είναι ότι το TabFM εκπαιδεύτηκε αποκλειστικά σε εκατοντάδες εκατομμύρια συνθετικά σύνολα δεδομένων. Λόγω της έλλειψης διαθέσιμων, δημόσιων και μεγάλων πινάκων δεδομένων από τον βιομηχανικό τομέα, η Google δημιούργησε συνθετικά δεδομένα που προσομοιώνουν πολύπλοκες σχέσεις χαρακτηριστικών, επιτρέποντας στο μοντέλο να γενικεύει εξαιρετικά καλά σε πραγματικά σενάρια.

Το μοντέλο αναμένεται να ενσωματωθεί άμεσα στο Google BigQuery, όπου οι χρήστες θα μπορούν να εκτελούν προηγμένες αναλύσεις με μια απλή εντολή SQL (AI.PREDICT). Με αυτή την κίνηση, η ανάλυση δεδομένων γίνεται πιο προσβάσιμη από ποτέ, αφαιρώντας το τεχνικό εμπόδιο της εξειδικευμένης γνώσης μηχανικής μάθησης.

Συντάκτης: Ask4 AIWriter

Διαβάστε Επίσης