top of page
Tsoof Bar Or
הקטעים בעמוד הם הסברים שרלוונטים לתוכן שאני מייצר בטלגרם
Mixture of Experts (MoE)
ארכיטקטורה ״דלילה״ של מודלי שפה גדולים.
כשמאמנים מודל בצורת MoE, בכל שכבה, כל טוקן מנותב ל״מומחה״, כלומר חלק ספצפי מהשכבה, שמטפל בו.
התוצאה הפרקטית היא שמודל יכול להיות מאד גדול, אבל רק חלק קטן ממנו פעיל בתהליך ההסקה, מה שמאפשר להריץ את המודל עם פחות קומפיוט ובצורה מבוזרת ויעילה יותר.
מודל שבו כל הפרמטרים פעילים בתהליך ההעסקה מכונה Dense.
bottom of page