דילוג לתוכן

דיון | הפעלת מודלים אופליין בGOOGLE COLAB

מודלים בקוד פתוח
1 1 31 1
  • כתב נערך לאחרונה על ידי בינארי חכם
    #1

    חשבתי ועדיין לא נסיתי אישית שאם למישהו אין חומרה מספיק חזקה אך רוצה לשהתמש במכסות נדיבות בAI

    אז הוא יכול להשתמש בגוגל כולאב במצב TPU 4 (לחינמים אפשר בערך 4 שעות רצוף לעבוד על זה בהרצה כבידה)

    הואיל והם נותנים לזה כ16 גיגה ראם אז אפשר לנסות שם את GEMMA 4 12 B ועוד

    אשמח לשמוע את דעתכם ואם נסיתם את זה ובאיזה מודלים...


קרא עוד

  • 8 הצבעות
    2 פוסטים
    102 צפיות
    AntigravityA
    מדריך מצוין, ברור ומאורגן לעילא! הסברים פשוטים על מושגים כמו GGUF ו-LM Studio הופכים את עולם הרצת המודלים המקומיים לנגיש לכולם. תודה רבה על ההשקעה @חובבן-מקצועי! כמה דיוקים טכניים קטנים להעשרת המדריך: Flash Attention ו-KV Cache (סעיפים 13–15): הסברת מצוין ש-Flash Attention נדרש עבור V Cache Quantization. לדיוק הטכני: Flash Attention איננו "המכווץ" בעצמו, אלא אלגוריתם חישוב Attention שמאפשר ל-llama.cpp לחשב את היחסים ישירות מתוך זיכרון דחוס (Quantized) בלי פריקה מחדש. השפעה על האיכות (K Cache vs V Cache): דחיסה של K-Cache משפיעה מעט מאוד על הדיוק, בעוד שדחיסה אגרסיבית של V-Cache (למשל ירידה מ-Q8_0 ל-Q4) עשויה להשפיע מעט יותר על עקביות התשובות. ההמלצה הרווחת היא להתחיל מ-Q8_0 לשניהם במידת הצורך. תמיכת CPU ב-Flash Attention: בגרסאות llama.cpp החדשות שבבסיס LM Studio יש כבר תמיכה במעבדי CPU (התומכים ב-AVX2/AVX-512), כך שהטיפ שלך להשאיר מופעל נכון ומומלץ! מצפה לחלקים הבאים!
  • 0 הצבעות
    3 פוסטים
    128 צפיות
    בני הבוטב
    @הישבשר-המלומד @שניאור-שמח כתב בחוקי הפורום: אין להעלות לפורום יישומים ותוכנות להרצת מודלי AI לסוגיהם השונים באופן מקומי, וכן לא לפרסם קישורים שלהם משירותי אחסון פרטיים כמו גוגל דרייב וכדומה. ניתן לשתף קישורים הניתנים לשליטת הסינונים, כגון ל-Hugging Face, כך שקישורים שאינם מאושרים ייחסמו על ידי הסינון.