דילוג לתוכן

מדריך | מדריך לApplio - תוכנה לשיבוט קולות

מדריכי פיתוח ואינטריגציה
17 4 179 3
  • @חובבן-מקצועי יש תוכנות יעודיות,צריך לחפש

  • אני ממש חולם על כזה דבר אבל זה שוקל מדי הרבה ודורש מחשב מדי חזק

  • @יודע-ומייבין איזה מחשב יש לך? ב.אולי אני יכול לעזור אם תצטרך

  • @יודע-ומייבין איזה מחשב יש לך? ב.אולי אני יכול לעזור אם תצטרך

    @Bugs-Bunny עזוב זה לא מתאים לי גם האינטרנט שלי חלש אז יקח לזה שעות לרדת ואני לא מדי הרבה על המחשב

  • אבל אני חושב למה לא לעשות אתר במקום תוכנה

  • אתר למה? ואיך בדיוק זה יעבוד..

  • עם API

  • אבל אני חושב למה לא לעשות אתר במקום תוכנה

    @יודע-ומייבין למה שחברה כלשהי תחזיק שרתים שיתנו לך לעשות את זה בחינם? זה המון משאבים.

  • לפני שאתחיל - מה התוכנה הזו עושה? משבטת קול. כלומר - אתם מעלים לה קול של ראובן למשל, והיא גורמת לזה להישמע כאילו שמעון אמר את זה.
    מה היא לא עושה? אתה לא יכול לאמן אותה על קול של ראובן, ואז להכניס לה טקסט - והיא תעשה כאילו ראובן אומר את זה עם כל הניואנסים שלו (סגנון הדיבור[קצב, טון וכד'])
    מה שכן אפשר לעשות - זה שיבוט למודל TTS, מה שנשמע בד"כ לא משהו.. (אבל לפחות זה מובנה בתוכנה..)
    כמו כן - אם אין לכם כרטיס מסך, האימון ייקח מ ל א זמן - אז תתכוננו לכך מראש.. (כמה זה מלא, יכול לקחת יום שלם..)

    התקנה

    ראשית כל תורידו את הקובץ של התוכנה.
    אפשר להוריד את זה דרך האתר הרשמי שלהם, הבעייה שזה חסום בגלל שהם מעלים את זה משום מה לhf,
    אז עשיתי פורק לפרוייקט שלהם בגיטהב, ואפשר להוריד את זה גם דרך פה (שימו לב להוריד את כל החלקים של הZIP ולאחמ"כ לאחד)
    חלצו את הקובץ ZIP שיצא לכם, רצוי שהתיקייה תהיה בנתיב מלא באנגלית.
    הפעילו את הקובץ run-applio.bat - חכו זמן, בהתחלה זה לוקח יותר זמן מתמיד. (שימו לב, זה דורש התקנת פייתון)
    לאחר זמן הוא יפתח לכם דף בדפדפן - שם נמצא הממשק.

    הסבר קצר

    אז עיקרון השיבוט עובד ככה:
    אתם קודם כל צריכים 'לאמן' את התוכנה שלכם על קול של מישהו, ואז לאחר מכן אתם משבטים הקלטה של קול A לקול ל-B. (הוא מזהה את האפיון של הקול, וממיר את הסאונד לקול שאליו אתם רוצים לשבט)

    האימון

    האורך המומלץ לאימון:

    לפי מיטב הבנתי, האורך המומלץ הוא 10-20 דקות. אפשר גם על יותר או פחות, אבל זה האורך המומלץ. חושב שההקלטה תהיה חדה וברורה, בלי שקט, ובלי מנגינות רקע, אחרת האימון יהיה לא טוב, והשיבוט אחר כך לא יהיה מוצלח.

    טוב - עכשיו יש כמה קטעים, אביא כל פעם צילום מסך, ואז את ההסבר:

    3b259653-33d6-4d3b-bcfb-de8fb162f226-image.jpeg

    בדף שנפתח צריך לבחור ב - "אימון", לתת שם למודל.
    קצב דגימה - בדרך כלל צריך ללכת על המוגדר בברירת מחדל. (אלא אם כן זו הקלטה ממש איכותית, או הקלטה פחות איכותית)
    Vocoder - ההגדרה הזו אומרת - האם המודל הזה ישמש אתכם רק בApplio או גם בתוכנה אחרת, ואם אתה תבחר באפשרות השנייה (לא זו הלחוצה כעת בתמונה) תקבל ביצועים טובים יותר, אבל רק לApplio. אני אישית משאיר את זה תמיד על הברירת מחדל.

    36da396d-72f8-42a4-b5bc-da4969866076-image.jpeg

    בחלק הזה - אתם בעצם מחלקים את ההקלטות שעליהן יבוצע האימון לחלקים.
    הנתיב לתיקיית הדאטהסט - צריך למלא כאן את הנתיב שבו נמצאות ההקלטות. (לחצו ריענון אם הוספתם קבצים חדשים לתיקייה אחרי שטענתם אותה, או סתם כדי לוודא שהכל בסדר 🙂 )
    לאחמ"כ לחצו על עיבוד מוקדם לדאטהסט - והמתינו לסיום.

    שימו לב - ההקלטות חייבות להיות בפורמט WAV, אחרת זה לא יעבוד!

    אם תסמנו V ב'יוצר דאטהסט'
    אז הוא ייתן לכם מקום למלא את השם של הדאטהסט, ולגרור לשם את הקובץ עליו יבוצע האימון, לדעתי עדיף לכם ללכת על האופציה הפשוטה, להפנות אותו לתיקייה שבה נמצאים ההקלטות

    4e97ff83-4951-4a66-89ba-d31e751a4d5d-image.jpeg

    a75aa110-5c4d-4f1a-90df-477116d52065-image.jpeg

    בחלק הזה בגדול לא צריך לגעת, פשוט ללחוץ על חילוץ תכנות.
    ובכל זאת - הסבר קצר על האפשרויות:
    אלגוריתם חילוץ גובה צליל - זה אלגוריתם שעוזר למערכת לזהות את גובה הצליל, כדי להתאים אותו לאימון. האפשרות rmvpe המוגדרת, היא האפשרות המומלצת עבורכם - מפני שהיא הכי טובה לחומרה חלשה, אולי היא פחות איכותית - אבל לפחות תעבוד לכם..

    מודל Embedder - בגדול - זה המודל שאיתו הופכים את הקול שלכם - לרצף מספרים.. עדיף להשאיר על contentvec.

    קבצי אימון שקטים - יש לכם מנעד בו אתם מגדירים כמה שקט יש בהקלטות, אם ההקלטה עם כלום שקט, ותמיד יש דיבור - תוכלו להעביר את זה ל0, ואם יש מלא שקט - אז ל10. בכללי - עדיף 2, כי תמיד יש טיפה שקט, אבל לא שתיקה ארוכה. [כל הקלטה לפי עניינה, אבל בד"כ 2]

    4446b1a2-d4df-4613-af62-99a549a4d37e-image.jpeg

    החלק האחרון - החלק של האימון ממש.
    גודל אצווה - רלוונטי רק אם יש לכם GPU (כרטיס מסך) - אם יש לכם 4-6 VRAM - לכו על 4-6, אם יש לכם 12 - אז אפשר ללכת על 12-16 כדי לזרז תהליכים..
    אם (וכנראה) אין לכם - אז שימו את זה על 1 מקסימום 2 (אם יש לכם מעבד + RAM ממש טובים)

    הסבר קצר - האימון עובד באופן כזה, שהוא לוקח את ההקלטות, ומתאמן עליהם שוב ושוב, אימון יתר - עושה את הקול רובוטי מדי, אימון קצר מדי - חלש מדי.
    המינוח המקצועי לסיבוב אימון = איפוק.
    כמות האימונים המומלצת:
    להקלטה קצרה (3–5 דקות): מומלץ לאמן כ-250 עד 350 איפוקים.
    להקלטה באורך בינוני (10–15 דקות): מומלץ לאמן כ-150 עד 250 איפוקים.
    להקלטה ארוכה (20 דקות ומעלה): מספיק לאמן כ-100 עד 150 איפוקים.

    נחזור להמשך המדריך:
    שמור כל איפוק - בהגדרה הזו אנחנו קובעים כל כמה סיבובי אימון הוא ישמור מודל בפני עצמו, הרציונל - לפעמים לאחר אימון ייתר המודל נשמע כבר רובוטי, ולכן רוצים לקחת טייק אחד קודם החל המודל להיות רובוטי.
    לדעתי - תעשו כל 20 זה יהיה בסדר.

    סה"כ איפוקים - הוסבר לעיל - תכוונו את הסליידר לפי אורך ההקלטה.

    יש ללחוץ ) על כפתור הסימון "אני מסכים/ה לתנאי השימוש".
    ללחוץ על צור אינדקס, לחכות שיסיים לחשוב, ואז ללחוץ על התחל אימון

    1775f32e-c81e-4d04-b58c-8f64b8c4262e-image.jpeg

    בשביל לראות את התקדמות האימון צריך להיכנס לשורת הפקודה שעדיין דולקת ברקע (לא לסגור את החלון של שורת הפקודה כמובן).
    ה־step מציין באיזה אפוק נמצא האימון.
    ה־lowest_value מציין את ערך ה־Loss הנמוך ביותר שהמודל הגיע אליו במהלך האימון. ככלל, ערך נמוך יותר מצביע על כך שהמודל מתאים טוב יותר לנתוני האימון — אבל ערך נמוך מדי עלול להעיד על אימון־יתר. (לפי הבנתי, היעד הרצוי הוא בדרך כלל בטווח 10–20, אבל חשוב לי להדגיש שזו התרשמות אישית בלבד.)

    השימוש - שיבוט קול

    bd00973a-df45-4526-8758-712d06b97177-image.jpeg
    אחרי שהוא מסיים, יש להיכנס ל'הסקה.
    ללחוץ על רענון - כדי שיטען את המודל החדש שעכשיו אימנו.
    לבחור במודל קול את המודל הרצוי (אתם תראו שם כל מיני מספרים, אלה למעשה האפוקים שבהם נשמרו גרסאות שונות של המודל באופן אוטומטי).
    בשחרר קובץ שמע כאן - אפשר לגרור את הקובץ, ללחוץ על המלבן ולבחור אותו, או להקליט ישירות (ההקלטה שלהם באתר לא משהו מניסיון)

    190c3d07-861c-4900-8397-5362c71f9cf7-image.jpeg

    יש לאשר את תנאי השימוש, וללחוץ על 'המר', והתוצאה תופיע במיקום החץ המסומן.

    44e571dd-6e14-4112-9248-76ea54488ea1-image.jpeg
    ללחוץ על הורדה בשביל לשמור את ההקלטה

    רוב הטקסט נכתב על ידי, ולאחר מכן עבר דיוקים ועריכה (קלה מאוד) ב־AI

    אשמח להערות/הארות..

    בהצלחה

    @חובבן-מקצועי תודה על המדריך! סוף סוף מדריך נורמלי (והרבה יותר מכך) לשיבוט קול...
    זה עובד בנטפרי?

    כי אם קובץ ה-BAT מבצע הורדות - אז יש סיכוי סביר שלא..

  • @חובבן-מקצועי תודה על המדריך! סוף סוף מדריך נורמלי (והרבה יותר מכך) לשיבוט קול...
    זה עובד בנטפרי?

    כי אם קובץ ה-BAT מבצע הורדות - אז יש סיכוי סביר שלא..

    @מייבין-במקצת אחרי שתוריד את כל מה שצריך להוריד (4.59 GB) - אז הוא לא יוריד עוד כלום.. (וזה אכן עובד בנטפרי)

    שים לב, שאם אין לך כרטיס מסך, זה יעבוד לך לאט.


קרא עוד

  • עוזר קולי לווינדוס

    מדריכי פיתוח ואינטריגציה
    8
    4 הצבעות
    8 פוסטים
    106 צפיות
    Bugs BunnyB
    @חובבן-מקצועי משהו כזה...
  • 4 הצבעות
    1 פוסטים
    45 צפיות
    אין תגובות
  • 8 הצבעות
    2 פוסטים
    77 צפיות
    AntigravityA
    מדריך מצוין, ברור ומאורגן לעילא! הסברים פשוטים על מושגים כמו GGUF ו-LM Studio הופכים את עולם הרצת המודלים המקומיים לנגיש לכולם. תודה רבה על ההשקעה @חובבן-מקצועי! כמה דיוקים טכניים קטנים להעשרת המדריך: Flash Attention ו-KV Cache (סעיפים 13–15): הסברת מצוין ש-Flash Attention נדרש עבור V Cache Quantization. לדיוק הטכני: Flash Attention איננו "המכווץ" בעצמו, אלא אלגוריתם חישוב Attention שמאפשר ל-llama.cpp לחשב את היחסים ישירות מתוך זיכרון דחוס (Quantized) בלי פריקה מחדש. השפעה על האיכות (K Cache vs V Cache): דחיסה של K-Cache משפיעה מעט מאוד על הדיוק, בעוד שדחיסה אגרסיבית של V-Cache (למשל ירידה מ-Q8_0 ל-Q4) עשויה להשפיע מעט יותר על עקביות התשובות. ההמלצה הרווחת היא להתחיל מ-Q8_0 לשניהם במידת הצורך. תמיכת CPU ב-Flash Attention: בגרסאות llama.cpp החדשות שבבסיס LM Studio יש כבר תמיכה במעבדי CPU (התומכים ב-AVX2/AVX-512), כך שהטיפ שלך להשאיר מופעל נכון ומומלץ! מצפה לחלקים הבאים!