Chronos Herald

Google AI Releases Gemini Omni 1.1 Flash: 40-Second Scene Extension, First/Last Frame Control, and 4K Upscaling - MarkTechPost

Google AI Releases Gemini Omni 1.1 Flash: 40-Second Scene Extension, First/Last Frame Control, and 4K Upscaling - MarkTechPost

Google has releasedGemini Omni 1.1 Flash(gemini-omni-1.1-flash), a production update to its native multimodal video generation and editing model. The release moves Omni from a capable generator to a directable one: scene extension now reads up to 10 seconds of prior context instead of a single final frame, first and last frames can be pinned to control camera movement, drafts render in 360p at a third of 720p cost, finals upscale to 4K, and video clips can be passed as references for character consistency.

Gemini Omni Flash is built on three properties Google distinguishes from prior video models: native multimodality (text, image, audio, and video processed together), conversational editing through theInteractions API, and world knowledge inherited from Gemini. Editing is stateful — you passprevious_interaction_idand the model applies your change while preserving what you did not mention, without re-uploading the prior video.

It is available through theGemini APIinGoogle AI Studioand theGemini Enterprise Agent Platform, with Adobe, Figma Weave, GMI Cloud, and Runway already named as production users.

Omni 1.1 analyzesup to 10 seconds of prior contextwhen continuing a clip. Google states that previous models referenced only the final second. Extensions run in 10-second increments to acumulative 40 seconds, and the model generates a 3–10 second continuation per call. Some final frames of the input are edited to make the seam continuous.

The constraints are specific. Extension appends to the end of a clip only — no prepending, no mid-clip insertion. Uploaded input videos must be 10 seconds or shorter, unless you are extending a model-generated video in multi-turn. You cannot add new dialogue when extending an uploaded video where someone is speaking; spoken dialogue is supported in multi-turn extension viaprevious_interaction_id.

Anda sekarang dapat menyediakan frame pertama dan terakhir dan membuat model menghasilkan video berkelanjutan di antara keduanya, yang merupakan mekanisme di balik orbit, dolly-zoom, dan loop mulus. Perintah mengikat media ke peran dengan tag:<FIRST_FRAME>,<LAST_FRAME>,<IMAGE_REF_N>, dan<VIDEO_REF_N>.

Referensi video menerima maksimal tiga klip, masing-masing hingga tiga detik, dan berfungsi paling baik untuk kemiripan. Audio di dalam referensi video diabaikan. Penalaran di beberapa video tidak didukung dan dapat menurunkan keluaran.

Parameter resolusi dalam format_respons membutuhkan 360p, 720p (default), 1080p, dan 4k, dengan dua teratas ditingkatkan. Google melaporkan pratinjau 360p menghasilkan hingga 60% lebih cepat dan sepertiga biaya 720p, berdasarkan throughput sistem 360p versus 720p. Hal ini menjadikan loop draf-kemudian-upscale menjadi pola produksi yang diinginkan: lakukan iterasi dengan murah, render sekali.

Inputnya adalah $1,50 per 1 juta token (teks, gambar, video, audio). Outputnya adalah $9,00 per 1 juta token teks dan $17,50 per 1 juta token video. Tagihan video berjalan pada 5.792 token per detik pada resolusi 720p, efektif~$0,10 per detik berdasarkan harga standar.

Setiap video yang dihasilkan membawa tanda air SynthID — tidak terlihat oleh pemirsa, dapat dideteksi secara terprogram untuk mengetahui asal usulnya. Kesenjangan penting: tidak ada instruksi sistem, suhu, top_p, urutan penghentian, atau perintah negatif (negatif ada di teks perintah); pengeditan suara tidak didukung; referensi audio tidak didukung; URL YouTube tidak dapat digunakan sebagai sumber. Bahasa Inggris didukung penuh; bahasa lain tidak dievaluasi. Untuk output di atas 4MB, gunakan delivery="uri" dan polling Files API hingga file AKTIF.

Google menyebut Adobe (Firefly), Figma Weave, GMI Cloud, dan Runway sebagai pelanggan yang sudah menjalankan Omni Flash dalam produksi. Model ini juga tersedia di Google Flow untuk pelanggan AI Plus, Pro, dan Ultra, dengan ekstensi adegan di aplikasi Gemini.

Lihat pengumuman blog Google, dokumentasi Gemini API Omni, harga Gemini API, dan buku masak memulai cepat Omni. Juga, jangan ragu untuk mengikuti kami di Twitter dan jangan lupa untuk bergabung dengan SubReddit 150rb+ML kami dan Berlangganan Buletin kami. Tunggu! apakah kamu ada di telegram? sekarang kamu bisa bergabung dengan kami di telegram juga.

Perlu bermitra dengan kami untuk mempromosikan Repo GitHub Anda ATAU Halaman Wajah Memeluk ATAU Rilis Produk ATAU Webinar, dll.?Terhubung dengan kami

Michal Sutter adalah pakar ilmu data dengan gelar Master of Science dalam Ilmu Data dari Universitas Padova. Dengan dasar yang kuat dalam analisis statistik, pembelajaran mesin, dan rekayasa data, Michal unggul dalam mengubah kumpulan data kompleks menjadi wawasan yang dapat ditindaklanjuti.