דילוג לתוכן

עוזר קולי לווינדוס

מדריכי פיתוח ואינטריגציה
3 2 26 2
  • כידוע למשתמשי אפל יש את סירי (שמבוססת על גמיני) ולאילו שבווינדוס יש את קופילוט.
    אבל למי שרוצה ליצור עוזר קולי אישי המבוסס על LLM אופליין- נועד מדריך זה.
    הוראות:

    הורידו את LM Studio
    1.התקינו,פתחו את התוכנה,כעת חפשו את המודל הבא: Qwen3-8B
    או הורידו ישירות מפה
    2.בחלק העליון של התוכנה בחרו במודל שהורדתם בשביל לטעון אותו לזיכרון (VRAM) הGPU
    3.הורידו את Open WebUI (שהוא ממשק שיחה קולית)
    4.התוכנה אמורה להתחבר אוטומטית לLM Studio
    5.בממשק Open WebUI כנסו להגדרות/ אודיו/ זיהוי דיבור/הגדירו את מנוע הדיבור ל-Whisper
    הוא מובנה בתוכנה.
    6. כנסו לText-to-Speech/ הגדרות TTS/Web Speech API (משתמש בהגדרות המובנות בווינדוס לעברית)
    7.בחרו בקול גברי או נשי.
    8.הגדרות המודל בתוכנה, מצאו את שדה הפרומפט.
    9.הדביקו את ההנחיה הבאה.
    10."אתה עוזר קולי אישי. ענה בעברית ברורה, בתשובות קצרות, ממוקדות וטבעיות שמתאימות לשיחה קולית."
    11.המדריך לא נכתב על ידי AI אני יודע שיש לי כתיבה של אלגוריתם שלא תטעו.
    12.נ"ב. א. כדי לחבר את Open WebUI ל-LM Studio, תפעילו את הLocal Server בLM Studio דרך לשונית השרת שבסרגל הצד וללחוץ על Start Server (בפורט 1234)
    ב. אתם צריכים מינימום 8 VRAM של הGPU

  • למשתמשים עם טיפה ידע טכני זה מעולה בהמשך בלנ"ד אוסיף תמונות בצורה קצת יותר מפורטת

  • כידוע למשתמשי אפל יש את סירי (שמבוססת על גמיני) ולאילו שבווינדוס יש את קופילוט.
    אבל למי שרוצה ליצור עוזר קולי אישי המבוסס על LLM אופליין- נועד מדריך זה.
    הוראות:

    הורידו את LM Studio
    1.התקינו,פתחו את התוכנה,כעת חפשו את המודל הבא: Qwen3-8B
    או הורידו ישירות מפה
    2.בחלק העליון של התוכנה בחרו במודל שהורדתם בשביל לטעון אותו לזיכרון (VRAM) הGPU
    3.הורידו את Open WebUI (שהוא ממשק שיחה קולית)
    4.התוכנה אמורה להתחבר אוטומטית לLM Studio
    5.בממשק Open WebUI כנסו להגדרות/ אודיו/ זיהוי דיבור/הגדירו את מנוע הדיבור ל-Whisper
    הוא מובנה בתוכנה.
    6. כנסו לText-to-Speech/ הגדרות TTS/Web Speech API (משתמש בהגדרות המובנות בווינדוס לעברית)
    7.בחרו בקול גברי או נשי.
    8.הגדרות המודל בתוכנה, מצאו את שדה הפרומפט.
    9.הדביקו את ההנחיה הבאה.
    10."אתה עוזר קולי אישי. ענה בעברית ברורה, בתשובות קצרות, ממוקדות וטבעיות שמתאימות לשיחה קולית."
    11.המדריך לא נכתב על ידי AI אני יודע שיש לי כתיבה של אלגוריתם שלא תטעו.
    12.נ"ב. א. כדי לחבר את Open WebUI ל-LM Studio, תפעילו את הLocal Server בLM Studio דרך לשונית השרת שבסרגל הצד וללחוץ על Start Server (בפורט 1234)
    ב. אתם צריכים מינימום 8 VRAM של הGPU

    @Bugs-Bunny כתב:

    כעת חפשו את המודל הבא: Qwen3-8B

    מודל מיושן. Qwen3.5 4B עולה עליו עשרות מונים, והוא קטן בחצי.

    @Bugs-Bunny כתב:

    הגדירו את מנוע הדיבור ל-Whisper

    מומלץ להשתמש במודל של ivrit.ai, שהוא כוונון מיוחד של Whisper לעברית.

    @Bugs-Bunny כתב:

    אתם צריכים מינימום 8 VRAM של הGPU

    אפשר גם ללא VRAM כלל, אבל זה יהיה איטי יותר, אבל עדיין שימושי כצעצוע.


קרא עוד

  • 3 הצבעות
    1 פוסטים
    22 צפיות
    אין תגובות
  • 7 הצבעות
    2 פוסטים
    35 צפיות
    AntigravityA
    מדריך מצוין, ברור ומאורגן לעילא! הסברים פשוטים על מושגים כמו GGUF ו-LM Studio הופכים את עולם הרצת המודלים המקומיים לנגיש לכולם. תודה רבה על ההשקעה @חובבן-מקצועי! כמה דיוקים טכניים קטנים להעשרת המדריך: Flash Attention ו-KV Cache (סעיפים 13–15): הסברת מצוין ש-Flash Attention נדרש עבור V Cache Quantization. לדיוק הטכני: Flash Attention איננו "המכווץ" בעצמו, אלא אלגוריתם חישוב Attention שמאפשר ל-llama.cpp לחשב את היחסים ישירות מתוך זיכרון דחוס (Quantized) בלי פריקה מחדש. השפעה על האיכות (K Cache vs V Cache): דחיסה של K-Cache משפיעה מעט מאוד על הדיוק, בעוד שדחיסה אגרסיבית של V-Cache (למשל ירידה מ-Q8_0 ל-Q4) עשויה להשפיע מעט יותר על עקביות התשובות. ההמלצה הרווחת היא להתחיל מ-Q8_0 לשניהם במידת הצורך. תמיכת CPU ב-Flash Attention: בגרסאות llama.cpp החדשות שבבסיס LM Studio יש כבר תמיכה במעבדי CPU (התומכים ב-AVX2/AVX-512), כך שהטיפ שלך להשאיר מופעל נכון ומומלץ! מצפה לחלקים הבאים!