Microsoft udostępnia trzy multimodalne modele AI: transkrypcję, głos i obraz/wideo


Zdjęcie: © Steve Johnson / Unsplash
Źródło: unsplash.com/photos/wj_LPlw2Rns
Microsoft AI ogłosił wydanie trzech nowych modeli podstawowych, które obsługują transkrypcję mowy, generowanie dźwięku oraz obrazów i wideo. To krok firmy w rozbudowie własnego stosu multimodalnych modeli AI, równolegle do współpracy z OpenAI.
Nowe modele to MAI-Transcribe-1 (transkrypcja
Słownik artykułu
Krótkie objaśnienia terminów występujących w tekście. Każde hasło prowadzi do szerszej definicji i przykładów użycia.
Wszystkie trzy modele trafiły do Microsoft Foundry; modele transkrypcji i głosowy są również dostępne w MAI Playground. Microsoft podaje ceny wyjściowe: MAI-Transcribe-1 od 0,36 USD za godzinę; MAI-Voice-1 od 22 USD za 1 mln znaków; MAI-Image-2 od 5 USD za 1 mln tokenów tekstowych i 33 USD za 1 mln tokenów dla wyjścia obrazowego.
Microsoft prezentuje modele jako część strategii budowy „Humanist AI”, stawiającej człowieka w centrum zastosowań. Firma podkreśla także konkurencyjność cenową wobec modeli Google i OpenAI, jednocześnie deklarując kontynuację partnerstwa z OpenAI — Microsoft zainwestował w ten podmiot ponad 13 mld USD, a według doniesień renegocjacje umowy umożliwiły firmie prowadzenie własnych badań nad superinteligencją.
Modele sztucznej inteligencji trenowane do wykonywania wielu rodzajów zadań, które można później dostosowywać do konkretnych zastosowań.
Brak komentarzy. Bądź pierwszy!