Συλλογή δεδομένων
Τεράστιες ποσότητες κειμένου: ιστοσελίδες, βιβλία, κώδικας. Η επιλογή και ο καθαρισμός τους καθορίζουν τι θα «ξέρει» το μοντέλο, και ποιες προκαταλήψεις θα κουβαλά.
Αίθουσα 6, η γραμμή παραγωγής
Ένα σύγχρονο γλωσσικό μοντέλο δεν «γράφεται» από προγραμματιστές γραμμή προς γραμμή. Περνά από μια σειρά σταδίων, σαν γραμμή παραγωγής, που κρατά μήνες και κοστίζει πολύ. Σε κάθε στάδιο κερδίζει κάτι και κουβαλά κάτι.
Άνοιξε τη διαδραστική αίθουσα →Τεράστιες ποσότητες κειμένου: ιστοσελίδες, βιβλία, κώδικας. Η επιλογή και ο καθαρισμός τους καθορίζουν τι θα «ξέρει» το μοντέλο, και ποιες προκαταλήψεις θα κουβαλά.
Το κείμενο σπάει σε μικρά κομμάτια, τα tokens, που μπορεί να είναι ολόκληρες λέξεις ή μέρη λέξεων. Το μοντέλο βλέπει μόνο αριθμούς, όχι γράμματα.
Το μοντέλο μαθαίνει να προβλέπει το επόμενο token, δισεκατομμύρια φορές, σε χιλιάδες επεξεργαστές. Εδώ αποκτά γλώσσα και γενικές γνώσεις, αλλά δεν ξέρει ακόμα να συνομιλεί.
Με παραδείγματα ερωτήσεων και καλών απαντήσεων, μαθαίνει να ακολουθεί οδηγίες και να απαντά ως βοηθός.
Άνθρωποι, ή και άλλα μοντέλα, αξιολογούν απαντήσεις. Το μοντέλο ενισχύεται προς τις πιο χρήσιμες, ειλικρινείς και ασφαλείς. Γνωστή τεχνική είναι η ενισχυτική μάθηση από ανθρώπινη ανατροφοδότηση (RLHF).
Πριν κυκλοφορήσει, το μοντέλο ελέγχεται για λάθη, επικίνδυνες απαντήσεις και καταχρήσεις. Οι έλεγχοι συνεχίζονται και μετά.
Όταν του γράφεις, το μοντέλο δεν ψάχνει σε μια βάση απαντήσεων. Παράγει την απάντηση token προς token, όπως στην αίθουσα 5.