استارتاپ فرانسوی Mistral خانواده مدلهای صوتی متنباز Voxtral را منتشر کرد که دقت بالا و درک معنایی پیشرفته را با هزینه کمتر از نیمی از رقبای بزرگ مانند OpenAI و گوگل ارائه میدهد. این مدلها بر پایه Mistral Small 3.1 ساخته شدهاند و قادرند فایلهای صوتی تا ۳۰ دقیقه را رونویسی و محتوای تا ۴۰ دقیقه را درک کنند.
نسخههای مختلف Voxtral
- Voxtral Small (۲۴ میلیارد پارامتر): برای کارهای سنگین و عملکرد رقابتی با Gemini ۲.۵ Flash و GPT-4o-mini.
- Voxtral Mini (۳ میلیارد پارامتر): مدل سبک برای کاربردهای محدودتر.
- Voxtral Mini Transcribe: نسخه بهینه و ارزان فقط برای رونویسی، با عملکرد بهتر از Whisper و هزینه کمتر از نصف.
مدلها بهصورت رایگان در Hugging Face قابل دانلود هستند و استفاده از API از قیمت ۰.۰۰۱ دلار در دقیقه آغاز میشود. در آینده نزدیک نیز در چتبات Le Chat قابل تست خواهند بود.
🔗 بیشتر بخوانید: اپل به گمان زیادً یک پردازنده سیگنال تصویری (ISP) اختصاصی برای آیفونها میسازد





