OpenAI's CTO uncertain about training data source for video-generating AI model Sora

From TradingView:

OpenAI’s CTO, Mira Murati, is unsure of the data source for the upcoming video-generating AI model, Sora. In an interview with The Wall Street Journal, Murati vaguely mentioned using publicly available and licensed data but was unsure if data from social media platforms like YouTube was used.

Despite being questioned about using Shutterstock data to train Sora, Murati declined to provide details but later confirmed its use. AI models rely on large training data sets to learn patterns and language processing, as reported by Cointelegraph.

Murati has led various projects at OpenAI, including DALL-E 3, Whisper, and GPT-4. OpenAI faced legal actions for alleged copyright infringement, with lawsuits filed by authors and media outlets claiming unauthorized use of copyrighted content to train AI models. The company also faced a class-action suit for scraping private user information for training purposes.



Read more at TradingView: OpenAI’s Mira Murati is “not sure” where Sora’s training data comes from — TradingView News