Microsoft udostępnia trzy multimodalne modele AI: transkrypcję, głos i obraz/wideo


Zdjęcie: © Steve Johnson / Unsplash
Źródło: unsplash.com/photos/wj_LPlw2Rns
Słownik artykułu
Krótkie objaśnienia terminów występujących w tekście. Każde hasło prowadzi do szerszej definicji i przykładów użycia.




Nowe modele to MAI-Transcribe-1 (transkrypcja mowy), MAI-Voice-1 (generowanie audio, w tym niestandardowych głosów) oraz MAI-Image-2 (generowanie obrazów i materiałów wideo). Wszystkie powstały w zespole MAI Superintelligence.
Wszystkie trzy modele trafiły do Microsoft Foundry; modele transkrypcji i głosowy są również dostępne w MAI Playground. Microsoft podaje ceny wyjściowe: MAI-Transcribe-1 od 0,36 USD za godzinę; MAI-Voice-1 od 22 USD za 1 mln znaków; MAI-Image-2 od 5 USD za 1 mln tokenów tekstowych i 33 USD za 1 mln tokenów dla wyjścia obrazowego.
Microsoft prezentuje modele jako część strategii budowy „Humanist AI”, stawiającej człowieka w centrum zastosowań. Firma podkreśla także konkurencyjność cenową wobec modeli Google i OpenAI, jednocześnie deklarując kontynuację partnerstwa z OpenAI — Microsoft zainwestował w ten podmiot ponad 13 mld USD, a według doniesień renegocjacje umowy umożliwiły firmie prowadzenie własnych badań nad superinteligencją.
Modele sztucznej inteligencji trenowane do wykonywania wielu rodzajów zadań, które można później dostosowywać do konkretnych zastosowań.
Brak komentarzy. Bądź pierwszy!