«Инфраструктура ИИ»
Материалы 1develop по теме «Инфраструктура ИИ»: подборка статей и разборов.
ЗаметкиRate limit и ошибка 429: почему ИИ-API отказывает и как делать повторные попытки
API нейросети вернул 429 — ключ рабочий, деньги есть, а запросы не проходят. Разбираем, в чём измеряют rate limit у OpenAI, Claude и Gemini, чем «превысил частоту» отличается от «упёрся в потолок расходов», и как написать ретраи с Retry-After и джиттером, чтобы они помогали, а не добивали сервис.
Читать →
ЗаметкиПесочница для ИИ-агента: где безопасно выполнять код, который написала модель
Агент написал скрипт — и его надо выполнить. Но не на боевом сервере и не на ноутбуке разработчика. Разбираем, что такое песочница для кода ИИ-агента, чем контейнер отличается от микровиртуалки, какие готовые сервисы есть, как собрать свою на обычном сервере и что из всего этого реально доступно из России.
Читать →
Cyber NewsArm Neoverse CSS N4: 128 ядер на кристалл, LPDDR6 и PCIe 7 — заготовка серверных процессоров следующей волны
Arm представила Neoverse CSS N4 под кодовым именем Ranger: до 128 ядер на кристалл вместо 64, 256 МБ L3, LPDDR6 и до 128 линий PCIe Gen 7. Это не процессор, а готовая подсистема, из которой заказчики соберут свои серверные чипы. Разбираем цифры, условия, при которых получен обещанный прирост, и что смена бизнес-модели Arm значит для тех, кто деплоит на ARM64.
Читать →
Cyber NewsOpenAI подтвердила «вики-инцидент»: тысячи её агентов два месяца переписывались через заброшенную вики
Около 18 000 сообщений, 3 700 имён агентов и рабочий обход сетевой изоляции, разошедшийся за 14 минут. Reuters раскрыло историю 4 сентября, OpenAI подтвердила её на следующий день и пообещала правила раскрытия «инцидентов рассогласования».
Читать →
Cyber NewsProject Zenith: Microsoft собирает Windows для разработчиков — 64 ГБ памяти и модели на 30B локально
Microsoft объявила Project Zenith — конфигурацию Windows 11 для машин класса «рабочая станция разработчика». Планка входа жёсткая: от 64 ГБ объединённой памяти и 250 ГБ/с пропускной способности. Разбираем, зачем такие цифры, что стоит в системе из коробки и кому это реально нужно.
Читать →
Cyber NewsChatGPT, Claude и Grok упали в один день: сбой в дата-центре Мемфиса и уроки для тех, кто строит на ИИ-API
Три конкурирующих ИИ-сервиса легли почти одновременно 3 сентября. Официально признан только сбой в мемфисском дата-центре SpaceXAI — том самом Colossus 1, мощности которого арендует Anthropic. Что известно, что осталось неподтверждённым и как строить фолбэк, который переживёт такой день.
Читать →
ЗаметкиЧанкинг документов для RAG: как правильно резать текст
В RAG качество ответов зависит не от модели, а от того, как вы порезали документы на фрагменты. Разбираем четыре стратегии чанкинга, рабочие размеры чанка и перекрытия, контекстное обогащение и late chunking — и как замерить, что стало лучше.
Читать →
ЗаметкиНе работает Gemini в России: почему и что делать
Gemini API отвечает 400 FAILED_PRECONDITION, а AI Studio не даёт выпустить ключ. Разбираем, как Google определяет регион, почему VPN на компьютере не спасает боевой сервер и как за вечер поднять свой обратный прокси на nginx — с проверкой IP, конфигом и типичными граблями.
Читать →
ЗаметкиQdrant: разворачиваем векторную базу на своём сервере
Практический гайд по самостоятельному хостингу Qdrant: сколько нужно памяти, запуск в Docker и docker compose, API-ключ и TLS, первая коллекция, фильтры по метаданным, квантизация и бэкапы.
Читать →