To aplikacja dla systemu Linux o nazwie Dia, której najnowszą wersję można pobrać jako diasourcecode.tar.gz. Można ją uruchomić online na bezpłatnym hostingu OnWorks dla stacji roboczych.
Pobierz i uruchom bezpłatnie aplikację Dia with OnWorks w trybie online.
Postępuj zgodnie z tymi instrukcjami, aby uruchomić tę aplikację:
- 1. Pobrałem tę aplikację na swój komputer.
- 2. Wpisz w naszym menedżerze plików https://www.onworks.net/myfiles.php?username=XXXXX z wybraną nazwą użytkownika.
- 3. Prześlij tę aplikację w takim menedżerze plików.
- 4. Uruchom emulator online OnWorks Linux lub Windows online lub emulator online MACOS z tej witryny.
- 5. W systemie operacyjnym OnWorks Linux, który właśnie uruchomiłeś, przejdź do naszego menedżera plików https://www.onworks.net/myfiles.php?username=XXXXX z wybraną nazwą użytkownika.
- 6. Pobierz aplikację, zainstaluj ją i uruchom.
ZRZUTY EKRANU
Ad
dzień
OPIS
Dia to neuronowy model syntezy mowy, zaprojektowany specjalnie do generowania ultrarealistycznych dialogów w jednym przebiegu. Zamiast koncentrować się na pojedynczych zdaniach lub płaskiej narracji, jest zoptymalizowany pod kątem dźwięku konwersacyjnego, z naturalną zmianą kolejności, prozodią i tempem. Model można warunkować na podstawie referencyjnej próbki audio, co pozwala kontrolować emocje, ton i inne aspekty stylistyczne mowy. Może również generować niewerbalne wokalizacje, takie jak śmiech, kaszel, odchrząknięcie i podobne dźwięki, które są kluczowe dla nadania syntetycznym konwersacjom ludzkiego charakteru. Dia jest udostępniany z wstępnie wytrenowanymi punktami kontrolnymi i kodem wnioskowania, z wagami hostowanymi na platformie Hugging Face, dzięki czemu badacze i programiści mogą go szybko przetestować lub zintegrować z potokami. Model bazowy jest obecnie ukierunkowany na język angielski i ma około 1.6 miliarda parametrów, oferując dobrą równowagę między realizmem a kosztem obliczeniowym, a ekosystem obejmuje również Dia2.
Udogodnienia
- Model dialogu TTS z jednym przejściem, skoncentrowany na bardzo realistycznej mowie konwersacyjnej
- Kondycjonowanie dźwięku w celu kontrolowania emocji, tonu i stylu mówienia generowanego głosu
- Wsparcie dla zdarzeń niewerbalnych, takich jak śmiech, kaszel i odchrząkiwanie, w ramach generowanych dźwięków
- Wstępnie wytrenowane punkty kontrolne i skrypty wnioskowania z wagami hostowane w Hugging Face
- Architektura 1.6B-parametrowa zorientowana na język angielski, równoważąca jakość z kosztem wnioskowania
- Wariant strumieniowania towarzyszącego (Dia2) do scenariuszy konwersacyjnych w czasie rzeczywistym i syntezy o niskim opóźnieniu
Język programowania
Python
Kategorie
Tę aplikację można również pobrać ze strony https://sourceforge.net/projects/dia.mirror/. Została ona umieszczona w OnWorks, aby można ją było najłatwiej uruchomić online z poziomu jednego z naszych darmowych systemów operacyjnych.