Сообщение Gate News, 24 апреля — V4 публично раскрыла внутренние данные догфудинга для своей модели V4-Pro. Компания собрала примерно 200 реальных инженерных задач от более чем 50 инженеров, охватив разработку функций, исправление ошибок, рефакторинг и диагностику в различных технологических стеках, включая PyTorch, CUDA, Rust и C++. После тщательной фильтрации для оценки бенчмарка было сохранено 30 задач.

V4-Pro-Max достиг 67% процента успешного прохождения кода, существенно превзойдя Sonnet 4.5 с 47% и приблизившись к Opus 4.5 с 70%. Однако он уступает Opus 4.5 Thinking (73%) и Opus 4.6 Thinking (80%), при этом значительно опережая Haiku 4.5 на 13%.

Во внутреннем опросе с 85 респондентами все участники сообщили, что используют V4-Pro для агентного кодинга в ежедневных рабочих процессах. 52% поддержали V4-Pro как свою модель первичного кодинга по умолчанию, 39% склонялись к одобрению, и менее 9% выразили неодобрение. Сообщенные проблемы включали низкоуровневые ошибки, неверное толкование неоднозначных запросов и иногда чрезмерное обдумывание поведения.

Посмотреть источник

Отказ от ответственности: Информация на этой странице может поступать от третьих лиц и не отражает взгляды или мнения Gate. Содержание, представленное на этой странице, предназначено исключительно для справки и не является финансовой, инвестиционной или юридической консультацией. Gate не гарантирует точность или полноту информации и не несет ответственности за любые убытки, возникшие от использования этой информации. Инвестиции в виртуальные активы несут высокие риски и подвержены значительной ценовой волатильности. Вы можете потерять весь инвестированный капитал. Пожалуйста, полностью понимайте соответствующие риски и принимайте разумные решения, исходя из собственного финансового положения и толерантности к риску. Для получения подробностей, пожалуйста, обратитесь к Отказу от ответственности.

Связанные статьи

DeepSeek выпускает V4 open-source preview, технический рейтинг 3206 превзошёл GPT-5.4

Новости индустрии ИИ

DeepSeek 24 апреля официально запустила серию предварительных версий V4, выпущенную с открытым исходным кодом по лицензии MIT; веса модели также были одновременно размещены на Hugging Face и ModelScope. Согласно техническому отчету DeepSeek V4, V4-Pro-Max (режим с максимальной вычислительной/инференс-усиленной мощностью) набрала 3206 баллов на бенчмарке Codeforces, превзойдя GPT-5.4.

MarketWhisper3м назад

Cambricon завершает адаптацию Day 0 DeepSeek-V4, отмечая веху для экосистемы ИИ-чипов в Китае

Новости индустрии ИИ

Сообщение Gate News, 24 апреля — сегодня Cambricon объявила о завершении адаптации Day 0 для DeepSeek-V4, новейшей крупной языковой модели от DeepSeek, с использованием ее собственной программной экосистемы NeuWare и фреймворка vLLM. Код адаптации был одновременно опубликован с открытым исходным кодом, отмечая

GateNews20м назад

Tencent выпустила в открытый доступ Hy3 в предварительной версии; базовые тесты кода улучшены на 40% по сравнению с предыдущим поколением

Новости индустрии ИИ

Tencent 4月23日在 GitHub、Hugging Face 以及 ModelScope 平台正式开源 Hy3 预览版大型语言模型，并同步在腾讯云（Tencent Cloud）提供付费 API 服务。据 Decrypt 于 4月24日报道，Hy3 预览版自 1月下旬启动训练，截至发布日历时不足三个月。

MarketWhisper27м назад

Инвестиции FTX в портфель на сумму 158 триллионов вон, если бы компания не обанкротилась

Акции Новости индустрии ИИ

FTX, централизованная криптовалютная биржа, которая подала заявление о защите от банкротства по главе 11 в ноябре 2022 года из-за дефицита ликвидности и оттока капитала, согласно анализу, на который ссылается Пак, при условии, что она не обрушилась бы, удерживала бы инвестиции, оцененные примерно в 158.796 трлн вон.

CryptoFrontier30м назад

Xiaomi раскрывает подробности обучения MiMo-V2-Pro: 1T параметров модели, тысячи развернутых GPU

Новости индустрии ИИ

Сообщение Gate News, 24 апреля — руководитель команды большой языковой модели Xiaomi Луо Фули в подробном интервью раскрыла, что модель MiMo-V2-Pro в сумме имеет 1 триллион параметров и для обучения потребовала тысячи GPU. Она отметила, что масштаб 1T представляет собой минимальный порог для достижения производительности, приближающейся к уровню Claude Opus 4.6, и получения конкурентного входного билета на следующий этап ИИ-агентов

GateNews44м назад

DeepSeek V4 получает идеальный результат на Putnam-2025, делит первое место с Axiom в формальном математическом рассуждении

Новости индустрии ИИ

Gate News сообщение, 24 апреля — DeepSeek V4 опубликовала результаты оценок формального математического рассуждения, набрав идеальные 120/120 на Putnam-2025, разделив первое место с Axiom. В практическом режиме с использованием LeanExplore и ограниченной выборки V4-Flash-Max набрала 81.00 по

GateNews52м назад

комментарий

0/400

Нет комментариев