Сегодня обсуждаем дифференцируемость — в прошлый раз производная была определена несколько вскользь в конце. Сегодня у нас взгляд назад: в прошлый раз были вещи из XX века, а теперь будут теоремы века примерно XVII.
Определение (Дифференцируемость). Функция дифференцируема в точке , если существует предел
называемый производной. Эквивалентно: в окрестности точки функция хорошо приближается аффинно-линейной,
Кстати, формально определим и предел функции: означает, что для любой последовательности выполнено . Здесь важно, что стремится к нулю по проколотой окрестности (): буквально поделить на ноль мы не можем.
Общие свойства производной (обсуждались в прошлый раз):
производная константы — ноль;
;
;
(в точках, где );
если дифференцируема в , а определена на интервале, содержащем , и дифференцируема в , то
Замечание (обозначения Лейбница). Производную удобно записывать как . Тогда цепное правило запоминается так:
— можно себе представить, что «сокращается». Удобное правило.
Если функция дифференцируема в точке, она, несомненно, в ней непрерывна: добавка — это .
Теорема (Принцип Ферма). Пусть дифференцируема (во всех точках интервала) и — локальный экстремум: существует окрестность такая, что либо . Тогда
По названию можно восстановить, из какого века утверждение. Мы знаем, что функция на отрезке достигает максимума, но что с этим делать, пока не знали, — вот инструмент.
Доказательство. Неформально: если производная не ноль, то в окрестности точки функция приближается линейной функцией с ненулевым угловым коэффициентом — а у такой функции локального экстремума в этой точке не бывает.
Формально: пусть . Из разложения
следует, что существует такое, что при
Но тогда имеет тот же знак, что и : разность лежит в окрестности числа , не задевающей ноль. А знак при смене знака меняется — значит, в любой окрестности есть точки, где больше , и точки, где меньше. Ни максимума, ни минимума быть не может.
Пример. Возьмём на отрезке . Производная равна , поэтому максимум достигается в точке . И это действительно так. Пример совсем игрушечный, но тем же способом можно добиваться гораздо более замечательных результатов.
Если функция совсем хорошая, от её производной можно ожидать, что она тоже дифференцируема, — функция может быть дифференцируема несколько раз.
Определение (Классы и). Через обозначаются раз дифференцируемые функции, у которых -я производная непрерывна. Через — бесконечно дифференцируемые функции, они же гладкие. (Малые порядки производных пишем штрихами: , , .)
Интервал берётся открытый, чтобы не мучиться с односторонними пределами в граничных точках.
Замечание. Физический смысл прозрачен: если точка бегает по прямой и в момент находится в , то — её моментальная скорость, вторая производная — ускорение, третья — рывок. Поскольку натуральных чисел бесконечно много, не следует ожидать, что для всех производных есть отдельные термины.
Геометрический смысл производной. Нарисуем график и возьмём точку . Проведём хорду через неё и близко стоящую точку : прямая , проходящая через обе точки, имеет
(напишите равенство для обеих точек и вычтите; со знаком в главное не напутать). Если функция дифференцируема, устремим к нулю — в пределе получится прямая с угловым коэффициентом , проходящая через . Это касательная.
Хорда через и ; при она стремится к касательной с угловым коэффициентом .
Дифференцируемость — геометрическое свойство: хорды при сходятся к какой-то прямой. Только не совсем: может получиться и вертикальная прямая, а это не очень хорошо. Например, у функции в нуле касательная вертикальна — и производной там нет (на уровне формул: в знаменателе вылезает ноль).
Теорему о среднем можно формулировать по-разному; мы сформулируем её как утверждение про кривые на плоскости.
Определение (Параметризованная кривая). Параметризованная кривая в — это непрерывное отображение из интервала в (непрерывность эквивалентна непрерывности обеих координат: ).
Почему именно «параметризованная»? Если смотреть только на образ, разные дают одинаковые кривые: на — единичная окружность, и — тоже.
От кривой хочется потребовать, чтобы она была хорошей — без изломов: пусть и дифференцируемы и не бывает . Нулевая скорость соответствует излому: например, кривая — это та самая с остриём в нуле, и у неё . Вот это и запретим.
Теорема (О среднем). Пусть — кривая, дифференцируемая внутри, , и . Тогда существует такое, что вектор параллелен отрезку .
Расшифруем: если и , то
(лишь бы и не обращались в нуль одновременно — а это запрещено условием ). Но утверждение по сути своей геометрическое.
Доказательство. Рассмотрим функцию
где — прямая (не отрезок), проходящая через и : спроецируйте и посмотрите, что получится. Так как непрерывно, точка непрерывно зависит от , значит, и расстояние до фиксированной прямой непрерывно. Функция неотрицательна и , поэтому на отрезке есть точка , где максимальна. (Может случиться, что кривая — вся эта прямая; но тогда утверждение и так верно.)
Утверждается: касательная к кривой в точке параллельна . Предположим, нет — между касательной и прямой есть угол . Пошевелим точку: за «время» мы проползаем вдоль касательной расстояние , и проекция на направление, перпендикулярное , меняется на это расстояние, умноженное на :
(угол между касательной в близкой точке и прямой — это , непрерывная зависимость). Выберите знак так, чтобы добавка была положительной, — получится точка, где расстояние больше максимального. Противоречие. Значит, : касательная параллельна прямой.
Точка кривой, наиболее удалённая от прямой : касательная в ней параллельна этой прямой.
Следствие (Теорема Лагранжа). Пусть дифференцируема. Тогда существует такое, что
Доказательство. Возьмите в теореме о среднем кривую с координатами и — получится в точности то, что написано.
Конечное приращение, поделённое на разность точек, — это значение производной где-то на интервале. В частности, если есть контроль за и за производной, есть некоторый контроль и за . (Теорема Лагранжа — это, видимо, уже XVIII век, а не XVII; мы осуществляем скачки в истории.)
Следствие (Теорема Ролля). Если дифференцируема и , то существует с : функция, принимающая одинаковые значения на концах, где-то имеет нулевую производную.
Пример. Как ведёт себя ? Это разность логарифмов в точках и , а производная логарифма — ; по теореме о среднем
Раскрывая скобочки: .
Аффинно-линейными функциями жизнь не ограничивается. Какими ещё интересными функциями можно приближать — такими, про которые мы верим, что что-то понимаем? Многочленами. От хорошей функции следует ожидать, что она ведёт себя как многочлен большой степени — или, формализуя, как степенной ряд
хотя бы в окрестности точки. (Это ожидание, вообще говоря, не оправдывается: бывают ненулевые гладкие функции, у которых такое разложение — просто ; об этом поговорим, но не сегодня — сегодня хочется быть оптимистом.)
Как добыть из разложения коэффициенты? Этому учат на алгебре с формальными степенными рядами: , , ; если продифференцировать раз, получится Значит,
И хотя не всякая функция раскладывается, для дифференцируемой функции такая процедура всё-таки даёт правильную асимптотику.
Теорема (Формула Тейлора с остаточным членом Лагранжа). Пусть на интервале раз дифференцируема (непрерывности последней производной не нужно), и — точки интервала. Тогда существует между и такое, что
Замечание. Формулу Тейлора, как полагается в математике, доказал Грегори — Джеймс Грегори; Тейлор тут ни при чём, у него она появилась в некотором тексте значительно позже.
Следствие (Формула Тейлора с остатком Пеано).
Доказательство. Будем ради интереса доказывать формулу Тейлора по индукции. Случай — это в точности теорема Лагранжа. Пусть утверждение доказано для ; докажем для .
Рассмотрим функцию
Про неё мы знаем: во-первых,
— при дифференцировании степени понижаются на единичку, дошедшие до нулевой степени константы пропадают, и после дифференцирований остаётся , что в точке равно нулю. Во-вторых,
потому что разность — многочлен степени не выше , и его -я производная — ноль.
Достаточно доказать формулу для . Применим теорему о среднем к кривой с координатами и : существует между и (в каком порядке они расположены — неважно) такое, что
Теперь возьмём : у неё все производные вплоть до порядка в точке равны нулю, поэтому по предположению индукции (формула Тейлора с меньшим числом слагаемых)
для некоторого между и . Продолжая равенство,
Точка лежит между и , а — между и ; значит, и между и . Доказательство окончено.
Будем писать именно форму Лагранжа, чтобы видеть, какие получаются ограничения. Для многочленов формула — это просто переразложение по степеням (тоже очень полезно, но лекция не об этом).
Пример (пример 0: геометрическая прогрессия). Возьмём при . Производные: , дальше вылезает двойка, и вообще
(следите за степенями аккуратно: здесь нулевая производная — степень первая; если не делать этого аккуратно, можно неожиданно прийти к какому-нибудь противоречию в математике — не делайте так). Значит, , и формула Тейлора говорит:
Остаток, с одной стороны, больше (что и так понятно: оставшееся разложение начинается с ), а с другой — меньше . Это согласуется с точным значением остатка — хвостом геометрической прогрессии
Пример (пример 1: экспонента). — дифференцировать одно удовольствие, постоянно . Коэффициенты ряда Тейлора — :
Если как следует побольше, чем (скажем, ), это уже становится содержательным приближением. Для отрицательных ряд знакочередующийся, и формула говорит меньше, но остаток всё равно получается.
Замечание. В листке есть последняя задача — в некотором роде предостережение: там просят доказать, что предел
существует, но не сказано, чему он равен. Здесь в показателе и , на котором мы обрубаем ряд, — одно и то же, и поэтому проблема: предел, видимо, не единица. Настоятельно рекомендую посчитать это на компьютере и посмотреть; ответ не очень мистический, и, может быть, мы его прямо вычислим в задаче со звёздочкой.
Пример (пример 2: синус). Производные синуса цикличны с периодом четыре: косинус, минус синус, минус косинус, синус. В нуле: где синус — там ноль, где косинус — там :
Ряд Тейлора:
— в отличие от ряда Лейбница , такой же ряд с факториалами сходится прямо-таки к синусу единицы. Обрубим на -м месте:
Это приближение получше, чем для экспоненты, потому что производные синуса ограничены; правда, и приближаем мы что-то довольно маленькое — так что зависит.
Замечание (произведение Эйлера и сумма обратных квадратов). Чем ещё примечателен синус: мы знаем все его нули — это , . А что делают с многочленами, у которых известны корни? Раскладывают на множители. Если притвориться, что синус — прямо многочлен, следует ожидать разложения на множители типа ; и действительно, верна формула
Заметьте: она здесь совершенно не доказана — объяснено только, как в неё поверить. (Тем же рассуждением вы бы заключили, что , — у экспоненты нет нулей; поэтому так делать не надо. Но если очень хочется, то можно.) Именно так Эйлер понял, чему равна сумма обратных квадратов: раскрывая скобки,
а коэффициент при в ряде синуса равен ; значит,
Напрямую так делать, к сожалению, нельзя. Два самых простых известных мне доказательства (простых — не элементарных) — через формулу суммирования Пуассона и через комплексный анализ. Иногда можно пожертвовать элементарностью ради простоты.
Замечание (единственность коэффициентов и аналитичность). Если получилось приближение с точки зрения остаточного члена Пеано — , — то коэффициенты этого многочлена гарантированно являются тейлоровскими: такой ряд обязан совпадать с рядом Тейлора. Но совпадение рядов Тейлора у двух функций ещё не означает совпадения функций. Функции, которые прямо раскладываются в свой ряд, называются аналитическими; не всякая гладкая функция аналитична — анализ богат вложенными друг в друга различными классами функций.
Линейная алгебра у вас уже происходит, так что все знают, что такое векторное пространство.
Определение (Выпуклое множество). Пусть — векторное пространство над и . Множество выпукло, если для любых и любого
— весь отрезок между любыми двумя точками лежит в множестве.
Заметка. Резонный вопрос: можно ли заменить на и получить содержательное понятие? Если в векторном пространстве над потребовать то же самое для всех с , такое множество называется закруглённым — понятно почему: вместо отрезка уже целый кружочек. В качестве шутки обсуждался и кватернионный вариант — предлагалось называть такие множества «засференными».
Определение (Надграфик, подграфик, выпуклая функция). Пусть — функция на интервале . Надграфик — множество
подграфик — то же с неравенством в другую сторону. Функция называется выпуклой, если выпукл её надграфик, и вогнутой, если выпукл подграфик. Очевидно, выпукла тогда и только тогда, когда вогнута.
Например, надграфик — всё, что внутри параболы.
Утверждение (неравенство Йенсена; альтернативное определение выпуклости). Функция выпукла тогда и только тогда, когда для любых с (сумма конечная) и любых точек
Сумма с неотрицательными коэффициентами, дающими в сумме единицу, называется выпуклой комбинацией точек; неравенство говорит, что выпуклая комбинация значений не меньше значения в выпуклой комбинации.
Доказательство. Сначала заметим: в определении выпуклого множества совершенно не нужно, чтобы точек было две. Выпуклую комбинацию точек можно набрать последовательными комбинациями из двух: например, для трёх точек
(если — неинтересно), и так далее для любого конечного числа точек. Геометрически это наиболее понятно, но и на уровне формулок тоже.
Теперь возьмём точки — они по определению лежат в надграфике. Их выпуклая комбинация
лежит в надграфике тогда и только тогда, когда вторая координата не меньше значения в первой — а это и есть неравенство Йенсена. (Неравенство легко перепутать местами, когда есть два симметричных определения, — важно не перепутать.)
Пока это абстракция: сказано, что если нам хорошо, то нам хорошо. Нужен способ проверять выпуклость.
Теорема (Критерий выпуклости). Пусть на интервале дважды дифференцируема и . Тогда выпукла.
Доказательство. Достаточно проверить неравенство Йенсена для двух точек. Пусть — точки интервала, ; хотим
Рассмотрим функцию на отрезке :
Она непрерывна ( дважды дифференцируема, значит, в частности, непрерывна), поэтому достигает минимума; хотим доказать, что значение в точке минимума неотрицательно. Заметим, что
поэтому если минимум достигается на границе — победа. Пусть минимум достигается в точке ; тогда по принципу Ферма :
Обозначим . Получилось (прямо как в теореме Лагранжа):
Подставим обратно:
Теперь напишем для точек и формулу Тейлора с остатком в форме Лагранжа при :
где — какая-то точка между и . Подставляя, видим, что всё сокращается, кроме
производная неотрицательна, квадрат неотрицателен. Конец.
Замечание. Это можно было доказывать и совершенно геометрически: весь надграфик выпуклой (в смысле ) функции лежит выше любой касательной — проверяется вычислением с производными попроще.
Пример (неравенство Коши–Буняковского–Шварца). Возьмите самую простую выпуклую функцию — . Неравенство Йенсена говорит:
Если теперь подставить и , после умножения на получится обычная привычная КБШ:
Пример (неравенство о средних). Многие знают неравенство между средним арифметическим и средним геометрическим. Без выпуклости его приходится брать штурмом — по индукции из . А без воинственных методов: возьмите . Тогда
то есть логарифм — вогнутая функция, и неравенство Йенсена пишется в обратную сторону. Для положительных с коэффициентами :
Взяв экспоненту от обеих частей:
Получается совершенно моментально.
В неравенстве Йенсена на самом деле не обязательны конечные комбинации — впоследствии увидим, что там можно писать и интегралы.
Мы пропустили ещё два содержательных примера с рядами Тейлора.
Пример (логарифм). Логарифм не надо раскладывать в нуле — а то мало не покажется; раскладывать надо в единице, то есть брать . Производная — , и дальше вылезает уже по-настоящему факториал:
поэтому
(остаток оцените, как хотите). На границе круга сходимости беда: при получается гармонический ряд, и он расходится.
Пример (арктангенс). Производная арктангенса — (упражнение из прошлого раза); это геометрическая прогрессия, которую нужно почленно «проинтегрировать»:
Арктангенс прекрасно определён на всём — а ряд при совершенно не сходится: подставляете больше единицы — и каюк. Почему? Всё потому, что арктангенс плохо определён в точке : у полюсы в . Из-за проблем на границе комплексного круга сходимости у нас настают проблемы в вещественном мире.
Это общий симптом: бывает, что при вещественных у функции никаких проблем нет, а ряд всё равно не сходится.
Напоследок — короткое приложение для реального мира. Для начала на доске будет написана вообще ерунда:
Вбейте это в калькулятор — получится примерно ноль: дикая целочисленная комбинация степеней с огромными коэффициентами даёт какую-то мелочь. Смею утверждать, что это не случайность.
Рассмотрим рациональную функцию
Разложим её: знаменатель даёт знакопеременную геометрическую прогрессию
и, раскрывая скобочки (не падайте в обморок):
Это ряд для синуса! Оказывается, приближает :
(причём для положительных она синус чуть-чуть недооценивает). Если не очень большое и вы его знаете, подставьте его в эту рациональную функцию — и получите с отличной точностью.
Теперь подставим и скажем, что . Пораскрывав скобочки, получите в точности то соотношение, с которого мы начали. Даже такие совпадения иногда бывают не случайными. Попутно получается неплохое рациональное приближение:
Замечание. Как найти такую функцию — понятно: пишете и решаете уравнения на коэффициенты (а максимум разности на отрезке умеют считать хорошие программы типы Вольфрама: продифференцировать и найти нули — не фокус). Приближения рациональными функциями с ограниченными степенями числителя и знаменателя, дающие наибольшее количество правильных слагаемых ряда Тейлора, называются аппроксимациями Паде. Если вы хотите численно посчитать синус, от них большая польза.
На этой оптимистической ноте — всё: мы теперь умеем приближать всякие штуки более элементарными вещами. В следующий раз продолжим про топологические и метрические пространства, пополнение — и я надеюсь наконец поговорить про -адические числа, а то я их рекламирую уже четыре, даже пять лекций.