Пишу про ИИ - как работает и как использовать
уже доступ закрыт. qwen-3.6/3.7 - закрытые модели, веса не выкладывали.
если что, алиса-5/5.1 работает на qwen2.5 и qwen3 соотвественно. 5.1-pro = qwen3-235b-a22b
уже ни для кого не тайна
а где смеяться? если вспомнить базу, то все проще:
sum(p.numel() for p in model.parameters() if p.requires_grad)
вуаля - и одной строчкой кода вывели обучаемые параметры.
sum(p.numel() for p in model.parameters())
если хотим ВСЕ параметры
https://t.me/aostrikov_ai_agents/133
вот тут алексей описал как он себе нанимал. особенно интересно тестовое
пусть сам себе запрет выпишет, хи-хи
Да, конечно, вот лучшие начала для твоей статьи:
...
Если хочешь, могу сразу написать статью или предложить 10 вирусных идей!
---
🤣🤣🤣
Какие модели под капотом? Есть вариант свой gguf/mlx подключить? Если нет - была бы классная фишка.
https://t.me/impostorlife/418 не совесм по теме поста, но их то-же оперы.
hr-ки, мягко говоря, офигели...
Классно, прикольно, модно-молодежно... но все-же советую провести рефакториннг кода со спецом. Стоит такое не прям уж и дорого (думаю в 10к уложится можно). Зато баги будут отловлены, а best practices появятся в коде.
А так - удачи с проектом 🔥🔥🔥
Если захочешь - могу помочь с это или другой идей. В тг пиши, отвечу
гигачат, например. яндекс, авито, сбер и т-банк - у них хоть и небольшой, но СВОЙ претрейн есть.
и в законе речь идет о большинстве моделей машинного обучения, включая эмбеддеры, bert/t5-подобные архитектуры и нон-трансформеры. и напомню, что задача языкового моделирования - лишь один из способ применить backprop и прочие технологии.