Keşif · GitHub · Speech to Speech🚀 +227 bugün
Açık kaynaklı yerel sesli ajanlar
Hugging Face tarafından geliştirilen speech-to-speech kütüphanesi, açık kaynaklı modeller kullanarak yerel sesli ajanlar (voice agents) oluşturulmasına olanak tanıyor. Python tabanlı bu araç, geliştiricilerin cihaz üzerinde çalışan gerçek zamanlı sesli etkileşim sistemleri kurmasını sağlıyor.
Ne kazandırır?
- Düşük gecikmeli modüler ses hattı
- OpenAI Realtime uyumlu WebSocket desteği
- Farklı donanımlarda yerel çalışma imkânı
Kurulum
Temel kurulum
pip install speech-to-speechKaynak koddan kurulum
git clone https://github.com/huggingface/speech-to-speech.git
cd speech-to-speech
uv syncÇalıştırma
Sunucuyu başlatma
pip install speech-to-speech
export OPENAI_API_KEY=...
speech-to-speechİstemci ile bağlanma
python scripts/listen_and_play_realtime.py --host 127.0.0.1 --port 8765Kod bilmiyorsanız
🤖 Yapay zekâ ajanınıza (Claude Code · Codex · Antigravity) yapıştırın
Bu aracı kullanarak kendi yerel sesli ajanımı kurmak istiyorum. VAD, STT, LLM ve TTS bileşenlerini kullanarak düşük gecikmeli bir ses hattı oluşturmak için izlemem gereken temel adımlar nelerdir? Hangi komutla sunucuyu ayağa kaldırabilirim ve OpenAI Realtime uyumlu bir istemci ile nasıl bağlantı kurabilirim?
Kimin içinKendi donanımı üzerinde yerel ve özelleştirilebilir sesli etkileşim sistemleri geliştirmek isteyen yazılımcılar içindir.
LisansApache-2.0
Bağlantılar
İlgili sözlük terimleri
TreScout bu aracı geliştirmedi · GitHub trendlerinde keşfedip Türkçe tanıttı. Yıldız ve sayılar keşif tarihindeki değerlerdir.