Veo 3.1
Podgląd modelu wideo Google do generowania tekstu, obrazu i wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K.
Podgląd modelu wideo Google do generowania tekstu, obrazu i wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K.
Przegląd w prostym języku angielskim
Veo 3.1 obsługuje krótkie klipy ze zsynchronizowanym dźwiękiem i obsługuje generowanie, rozszerzanie, interpolację i przepływy pracy oparte na referencjach za pośrednictwem punktów końcowych specyficznych dla wariantu. Rozdzielczość, czas trwania i tryb wprowadzania są ze sobą powiązane; nie każda kombinacja jest dostępna.
Google publikuje niezwykle przydatny zakres opóźnień żądań od 11 sekund do sześciu minut w okresach szczytu. Jest to zakres operacyjny, a nie wyznacznik jakości, a wyższa rozdzielczość może zwiększyć opóźnienia i cenę.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Ceny i porównania
Podaj zużycie. Szacunek aktualizuje się podczas wpisywania.
Przykład: 8-sekundowe klipy 720p z dźwiękiem. Modele nieobsługujące tych ustawień nie otrzymają szacunku.
Veo 3.1
Szacowany koszt (USD)
Dla podanego użycia · USD · Cena API, nie abonamentu
Szacunki nie obejmują podatków, narzędzi, zapisu i przechowywania pamięci podręcznej, darmowych limitów ani rabatów. Dla obrazów obejmują tylko wynik, bez promptu i obrazów referencyjnych. Tryby jakości różnią się. Brak stawki nie oznacza bezpłatności.
Dostęp do API i dostawcy
Dostępność
Dostęp do podglądu poprzez Gemini API; warianty są również dostępne na wybranych platformach.
Google publikuje regionalne ograniczenia dotyczące generowania osób dla lokalizacji w UE, Wielkiej Brytanii, Szwajcarii i MENA.
Sprawdź dostępność na żywoDane i szkolenia
Google twierdzi, że płatne treści Gemini API nie są wykorzystywane do ulepszania swoich produktów. Wygenerowane filmy przechowywane są na serwerze przez dwa dni i w tym czasie należy je pobrać.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Podgląd modelu wideo Google do generowania tekstu, obrazu i wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K. Veo 3.1 obsługuje krótkie klipy ze zsynchronizowanym dźwiękiem i obsługuje generowanie, rozszerzanie, interpolację i przepływy pracy oparte na referencjach za pośrednictwem punktów końcowych specyficznych dla wariantu. Rozdzielczość, czas trwania i tryb wprowadzania są ze sobą powiązane; nie każda kombinacja jest dostępna.
Według materiałów cytowanego dostawcy Veo 3.1 został wydany na 1 września 2025.
Dostęp do podglądu poprzez Gemini API; warianty są również dostępne na wybranych platformach. Drogi dostępu wymienione w tym przewodniku to Google, fal i Runway.
0,40 USD / sekundę w rozdzielczości 720p lub 1080p. Standardowa moc wyjściowa z dźwiękiem wynosi 0,40 USD/s przy 720p lub 1080p i 0,60 USD/s przy 4K. Warianty Fast i Lite mają różne stawki.
Dostęp do podglądu poprzez Gemini API; warianty są również dostępne na wybranych platformach. Google publikuje regionalne ograniczenia dotyczące generowania osób dla lokalizacji w UE, Wielkiej Brytanii, Szwajcarii i MENA.
Google twierdzi, że płatne treści Gemini API nie są wykorzystywane do ulepszania swoich produktów. Wygenerowane filmy przechowywane są na serwerze przez dwa dni i w tym czasie należy je pobrać. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Starszy model wideo z zsynchronizowanym dźwiękiem OpenAI dla krótkich klipów z przewodnikiem tekstowym lub obrazowym — nadal udokumentowany, ale zbliża się trwałe zamknięcie interfejsu API.
Otwórz pełne porównanieTańszy wariant Veo 3.1 Google do szybkiego tworzenia krótkich klipów wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K.
Otwórz pełne porównanieFlagowy model wideo dla programistów Runway do klipów z przewodnikiem tekstowym i obrazowym, w profesjonalnych formatach i przewidywalnej podstawowej stawce kredytu na sekundę.
Otwórz pełne porównaniePro model wideo Kuaishou dostarczany za pośrednictwem fal do generowania wielu zdjęć tekstu/obrazu, opcjonalnego natywnego dźwięku, referencji i klipów trwających do 15 sekund.
Otwórz pełne porównanieEkonomiczny model Klinga na fal do płynnych, pięcio- lub dziesięciosekundowych klipów generowanych z tekstu lub obrazu początkowego.
Otwórz pełne porównanieObecny model wideo SpaceXAI do przekształcania tekstu, obrazów lub odniesień w krótkie klipy z opcjonalnie generowaną mową i dźwiękiem.
Otwórz pełne porównanieObecny model audiowizualny ByteDance dla spójnych klipów trwających do 30 sekund, z natywnym dźwiękiem, długą historią, bogatymi odniesieniami i ukierunkowaną edycją.
Otwórz pełne porównanieUjednolicona rodzina wideo Alibaba do tworzenia krótkich klipów z dźwiękiem z tekstu, obrazu początkowego lub wideo referencyjnego.
Otwórz pełne porównanieModel wideo Lightricks zorientowany na jakość do tworzenia klipów w rozdzielczości 720p lub 1080p z tekstu, obrazów lub dźwięku z natywnym dźwiękiem.
Otwórz pełne porównanieModel wideo LTX zoptymalizowany pod kątem szybkości dla tekstu, obrazu lub sygnału wejściowego, dźwięku natywnego, automatycznego czasu trwania i sygnału wyjściowego do 4K.
Otwórz pełne porównanieDojrzały, kompletny model wideo LTX do generacji, plus ponowne pobieranie, rozszerzanie, ponowne kadrowanie, natywny dźwięk i kontrola od pierwszej do ostatniej klatki.
Otwórz pełne porównanie